用户任务、预期结果、关键约束、风险边界
AI SKILL
Agent评测量表生成器
把产品目标和任务描述转化为可复核的评测维度、评分规则与失败类型。
评测维度、分级锚点、样例与人工复核清单
适用场景
Agent 版本验收、回归测试与产品评审
02 / WORKFLOW
工作流程
- 01
识别任务目标和不可妥协的约束
- 02
区分结果质量、过程质量与风险
- 03
为每个等级写出可观察的行为锚点
- 04
生成反例并由产品人员复核
03 / EXAMPLE
示例输入与输出
为“多人餐厅协商 Agent”生成约束遵循与公平性量表。
将预算、距离、营业状态定义为硬约束;将群体通勤差异与备选多样性定义为可解释的软指标。
能力边界
- 不能替代领域专家确定高风险标准
- 生成量表需要用真实失败案例持续校准
- 不同任务不应直接比较总分

