确定了评测对象(见 Prompt测试与Agent测试)之后,下一个问题是怎么给输出打分。第一个决策点是:任务输出是"确定性"的还是"生成性"的——这决定了用对答案、还是用评估器。
决策点:确定性任务 vs 生成性任务
| 类型 | 说明 | 评测方法 |
|---|---|---|
| 确定性任务 | 输出有唯一或有限的正确答案。如意图识别——"帮我上个团购"就该被唯一识别为 product_agent |
预期值直接对比:把模型输出与"标准答案"匹配,算准确率/召回/F1/格式一致性 |
| 生成性任务 | 输出开放、多样、无固定范式。如生图、文案——"画一只猫"有千万种画法,没有绝对标准答案 | 引入评估器多维打分:设计一个评估器(专用模型或一套评估 Prompt),从多维度综合打分 |
通用评测维度(Prompt 侧)
无论哪类任务,Prompt 层都常用精确性 / 鲁棒性 / 安全性 / 格式遵从四个维度,完整定义详见 Prompt测试与Agent测试,本页不重复展开。
生成性任务:评估器 + 多维加权打分
没有标准答案时,把主观"好坏"拆成多个可判维度,各给权重,加权求总分:
综合得分 = Σ(维度得分 × 维度权重)
以"生成商品主图"为例:
| 评测维度 | 含义 | 权重 |
|---|---|---|
| 真实与合理性 | 人物结构、物理关系是否合理(别出现"三条腿的人") | 80% |
| 与商品标题相关性 | 是否准确表达 Prompt 核心元素(要"中式足疗"别给"泰式按摩") | 10% |
| 构图与视觉美学 | 主体是否突出、背景是否干净 | 5% |
| 商业吸引力 | 能否激发购买欲 | 5% |
其中"合规与风险"(涉违规/侵权)是一票否决项,不参与加权,命中直接判不通过。
关键:评估器(评测维度 + 打分标准)必须团队共识、版本统一,避免"同样数据、两个略不同的评估器、得出两个相反结论"。调整评估器时,新旧版本都跑一遍校准分差。
对比法:GSB 与 SBS
横向比模型、纵向比版本时,常用两种人工/模型对比打分法:
| 方法 | 全称 | 打分方式 |
|---|---|---|
| GSB | Good / Same / Bad | 把 A 与 B 对比,三档:A 更好选 G、一样选 S、A 更差选 B |
| SBS | Side-By-Side | 更细的六档:A 更好 / A 好一些 / B 更好 / B 好一些 / 一样好 / 一样差 |
GSB 适合快速大批量判优劣,SBS 适合需要区分"明显好"和"略好"的精细对比。
选型口诀
- 有唯一答案 → 自动对比,越客观越好,能上规模
- 无标准答案 → 评估器多维加权,把主观量化
- 选模型/比版本 → GSB/SBS 做相对排序,而非各打绝对分
PM 此阶段职责
- 判定任务类型:每个评测点先问"有没有标准答案",决定走对比还是评估器
- 设计评估器维度与权重:生成性任务的维度拆解和权重分配本质是"把业务价值翻译成可打的分",必须 PM 主导
- 设一票否决项:合规/安全这类红线不进加权,单独卡
- 统一评估器版本:避免口径漂移导致结论不可比
相关页面
→ 效果评测体系(评测主题枢纽) → Prompt测试与Agent测试(评测对象与四维度) → Badcase分析方法论(打分发现的低分 case 进入归因) → 效果评测体系(自动/人工/LLM-as-Judge 的评判者分类) → 模型选型方法论(横向对比用 GSB/SBS 给候选模型排序) → AIPM课程 Day11