AI SKILL

Agent评测量表生成器

把产品目标和任务描述转化为可复核的评测维度、评分规则与失败类型。

INPUT

用户任务、预期结果、关键约束、风险边界

OUTPUT

评测维度、分级锚点、样例与人工复核清单

01 / USE CASE

适用场景

Agent 版本验收、回归测试与产品评审

02 / WORKFLOW

工作流程

  1. 01

    识别任务目标和不可妥协的约束

  2. 02

    区分结果质量、过程质量与风险

  3. 03

    为每个等级写出可观察的行为锚点

  4. 04

    生成反例并由产品人员复核

03 / EXAMPLE

示例输入与输出

示例输入

为“多人餐厅协商 Agent”生成约束遵循与公平性量表。

示例输出

将预算、距离、营业状态定义为硬约束;将群体通勤差异与备选多样性定义为可解释的软指标。

04 / LIMITS

能力边界

  • 不能替代领域专家确定高风险标准
  • 生成量表需要用真实失败案例持续校准
  • 不同任务不应直接比较总分