AIPM 课程第十一天,主题是 AI 评测体系(AI Performance Evaluation)。Day10 讲完 Agent/FC/MCP 的"怎么做出来",Day11 转入"做出来怎么判断它好不好、怎么持续变好"——从动机、定义,一路打到 Prompt/Agent 分层评测、评测集构建、四步走流程、Bad Case 归因和团队角色分工。
授课结构
| 主题 | 对应概念页 |
|---|---|
| 为什么要评测(AI 输出不确定,传统对错测试失效)+ 评测定义五要素 | 效果评测体系 |
| 从业务出发:同一句话不同角色关注点不同(AI 经营业务案例) | 效果评测体系 |
| Prompt 测试 vs Agent 测试(目标/维度/方法/场景) | Prompt测试与Agent测试 |
| 电商上品端到端分层评测(环节—层级—侧重点) | Prompt测试与Agent测试 |
| 三类评测方法(离线/在线/人工)+ 横向/纵向对比 | 效果评测体系 |
| 确定性任务 vs 生成性任务(评测方案分叉) | AI评测打分方法 |
| 通用评测维度(精确性/鲁棒性/安全性/格式遵从) | AI评测打分方法 |
| 生成性任务评估器 + 多维加权打分(生图案例) | AI评测打分方法 |
| 打分法 GSB / SBS | AI评测打分方法 |
| 高质量评测集五原则 + 四类样本来源 | 效果评测体系 |
| 四步走流程:固定评测集→对比评测→数据回流→报告沉淀 | 效果评测体系 |
| 线上数据回流 + Bad Case 四类归因 | Badcase分析方法论 |
| 标准化评测报告结构 | 效果评测体系 |
| 团队四角色分工(PM/运营/Server RD/QA)+ 传统PM→AI PM 转变 | 效果评测体系 |
串联逻辑
Day11 是一条"为什么评 → 评什么 → 怎么评 → 怎么持续评"的完整链路——
- 动机层:用"今天天气怎么样"两种回答都对、却难分优劣,点出 AI 输出的不确定性,论证传统软件"对错测试"在 AI 上失效,必须换成系统化评测。再用"我买了 15 天能退款吗"在法务/销售/财务/CSM 眼中关注点不同,引出"好 AI 因业务而异、评测必须先理解业务"。
- 对象层:把评测对象切成两类——Prompt 测试(验证模型对输入指令的理解/鲁棒/边界)和 Agent 测试(验证任务拆解/工具调用/多轮/效率)。再正交切一刀:任务输出是确定性(有唯一答案,预期值直接对比)还是生成性(开放无标准答案,引入评估器多维加权打分)。
- 方法层:离线/在线/人工三类评测方法的组合(离线保基础、在线验价值、人工补主观);横向对比(选优)vs 纵向对比(验迭代);GSB/SBS 两种对比打分法。
- 闭环层:评测集是与代码同等重要的资产,四类样本来源(线上日志/历史BadCase/边界Case/AI生成),五原则保质量;四步走流程把评测固化成质量门禁;Bad Case 必须归因到根因(模型/Prompt/检索/Agent行动)并回流,形成"发现→归因→修复→验证"闭环;最后沉淀成标准化报告供决策。
- 角色层:PM 定目标与成功标准、Operator 供真实场景与人工评测、Server RD 优化模型/Prompt、QA 主导整个评测体系——四角色在 Bad Case 归因上各管一段。
整条线把 Day2 时粗讲过的"效果评测体系"做了一次工业级的深挖。
课堂笔记要点
- AI 评测的本质:把"这个 AI 看起来还不错"变成"我们有证据证明它在特定场景下可用、可靠、可控"。评测定义可拆成五要素——业务目标(不是泛泛测聪明)、测试集(要有考卷)、指标体系(要有分数)、评价标准(要有判卷规则)、系统性测量(不是凭感觉看几条)。
- "好 AI"没有统一答案:同一句退款问题,法务关注条款责任、销售关注能否回款、财务关注开票收入、CSM 关注服务边界——所以评什么、怎么评、什么算通过,必须先从业务目标倒推。
- Prompt 测试 vs Agent 测试是两种不同的"考法":Prompt 测试适合离线+固定评测集、能频繁回归(模型升级/换配置时怕效果变差);Agent 测试要端到端跑业务场景、看是否闭环,得用离线+在线+人工组合(新功能提测/上线前)。
- 确定性 vs 生成性是选评测方案的决策点:意图识别这类有唯一答案的,直接对比标准答案算准确率;生图/写文案这类没标准答案的,必须设计"评估器"(专用模型或评估 Prompt)从多维度加权打分,把主观"好坏"尽量量化(生图例:真实合理性 80% / 相关性 10% / 构图 5% / 商业吸引力 5%)。
- 评测集是资产,不是一次性数据:最大的坑是"每次临时凑一批数据,导致不同版本结果没有可比性"。要像管代码一样版本化管理(V1.0/V2.0),并定期用线上回流数据更新,保持"活性"。四类样本来源各有侧重:线上日志(尤其用户改了输出/重复提交的)、历史 BadCase(投诉/差评/算法标异常)、边界 Case(人工造的矛盾需求/极端脏数据)、AI 生成样本(必须人工筛选,不能直接用)。
- 横向 vs 纵向对比:同一评测集、同一时间比不同模型/方案 = 横向(选优);同一评测集比同一模型不同版本 = 纵向(验迭代、防回滚)。二者共用一把"固定的尺"才有意义——所以评估器版本也要统一,调整评估器时新旧都跑一遍校准分差。
- 任何 Bad Case 都不能被忽视:它的价值是暴露系统性问题。要建"发现→记录→归因→解决→验证"的完整闭环,归因分四类(模型能力/Prompt设计/检索召回/Agent行动),每类有不同的验证方法和不同的责任人。
- 评测是团队协作语言:从"我觉得"转向"数据表明"。四角色里 QA 主导评测体系建设、PM 定业务目标与 Bad Case 定级、Server RD 接模型/Prompt 类根因、Operator 供真实场景与人工评测。传统 PM 到 AI PM,四个环节各多了一项 AI 专属动作(能力边界评估/Prompt工程/评测集指标体系/Bad Case 归因)。
相关页面
→ 效果评测体系 → Prompt测试与Agent测试 → AI评测打分方法 → Badcase分析方法论 → AIPM课程 Day10(前一日 Agent/FC/MCP) → AIPM课程 Day2(首次粗讲 POC/MVP/评测) → POC验证(POC 第四步"看结果"即 Bad Case 来源) → 模型选型方法论(横向对比是模型选型的核心动作) → 传统互联网产研团队和AI产研团队构成(评测四角色的组织背景)