模型选型报告 = 把 模型选型方法论 五步流程落地,产出一份能驱动「用哪个模型上线」决策的报告。本指南把五步法、模型选型五维度、效果评测体系 的相关部分组合成可直接执行的流程 + 报告模板。
适用场景
| 适合 | 不适合 |
|---|---|
| 新功能上线前要定模型 | 已有模型且无人反对 → 不必走完整流程 |
| 既有模型涨价/退役,要替换 | 单点验证模型能不能做 → 用 POC验证操作指南 |
| 多供应商比价,需对外汇报 | 微调内部参数(temperature 等) |
核心原则(来自 模型选型方法论):不追"最强模型",只追"最匹配模型"。这是 CEO 思维的商业决策,不是 CTO 的技术 trade-off。
步骤总览
| 步骤 | 名称 | 核心问题 | 主要产出 |
|---|---|---|---|
| 1 | 业务场景适配 | 我们到底要模型做什么? | 六维度需求清单 |
| 2 | 建立候选模型池 | 谁可能符合? | 3-5 个候选模型 + 排除理由 |
| 3 | 设计评测集 | 用什么样本来比? | 20 条真实 Prompt,分 4 大类 |
| 4 | 定义评分维度 | 怎么打分? | 维度表 + 0-3 分制评分标准 |
| 5 | 小规模横向测试 | 哪个胜出? | 效果对比矩阵 + 成本分析 + 结论 |
前置准备
- 业务方对接人已对齐(评分需要业务方参与)
- 各候选模型的 API key 或私有部署测试入口已备齐
- 预算允许跑 20×N 次测试(N 为候选模型数)
第一步:业务场景适配
六维度需求清单
| 维度 | 我们的需求 |
| 输入是什么? | □文本 □图片 □语音 □视频 □结构化数据 |
| 输出是什么? | □文本 □图片 □语音 □代码 □结构化数据 |
| 部署要求 | □国内 API □私有化部署 □海外可用 □无要求 |
| 任务难度 | □单轮对话 □多轮推理 □复杂工作流 |
| 容错率 | □零容错 □错一点可接受 □容错较高 |
| 响应速度 | □实时(<3s) □准实时(<60s) □离线可等 |
匹配型分类
按需求填完后,定位三种匹配型(来自 模型选型方法论)之一:
| 匹配型 | 典型场景 | 选型权重 |
|---|---|---|
| A 速度优先型 | 客服机器人 | 速度 > 成本 > 效果 |
| B 推理优先型 | 代码助手 | 效果 > 推理深度 > 成本 |
| C 质量优先型 | 离线报告生成 | 效果 > 长上下文 > 速度 |
检查项
- 六维度清单已填完
- 匹配型已定(A/B/C)
- 业务方对场景描述无异议
第二步:建立候选模型池
候选池来源
按 模型选型五维度 的"模型服务商分类":
| 来源 | 例子 |
|---|---|
| 自研+直营 | OpenAI、Anthropic、Gemini、DeepSeek |
| 自研+分销(云市) | Azure OpenAI、AWS Bedrock、阿里云百炼、华为云 MaaS、火山方舟 |
| 开源+托管 | 浪潮、京东云言犀、各云厂商的 Llama/Qwen 托管 |
候选清单
至少 3 个、不超过 5 个:
| # | 模型名 | 厂商 | 接入方式 | 初步是否符合六维度 | 排除理由(如排除) |
| 1 | ____ | ____ | API/私有 | ✓/✗ | ____ |
| 2 | ____ | ____ | API/私有 | ✓/✗ | ____ |
| ... |
关键原则(来自 模型选型方法论):候选池是从六维度筛选出来的,不是凭印象列举的。
检查项
- 候选模型 3-5 个
- 每个模型的接入方式已确认(能跑测试)
- 被排除的模型有书面理由
第三步:设计评测集
评测集结构
- 总量 20 条
- 分 4 大类,每类 5 条
- 按公司真实业务高频场景配比
4 类典型分布(以 AI 生图为例,可改)
| # | 类别 | 测试目的 | 5 条样本类型 |
|---|---|---|---|
| 1 | 商务办公 | 日常高频需求 | 商务插画、报告配图 |
| 2 | 数据/科技 | 专业场景 | 数据可视化、科技感配图 |
| 3 | 特殊场景 | 暴露短板(重点) | 人种偏见、中文文字、人物细节、本土文化、复杂指令 |
| 4 | 业务定制 | 公司独有需求 | 自填 |
特殊场景题 = POC 中的"陷阱题",决定模型上限。
评测集模板
| 题号 | 类别 | Prompt | 业务方提供的"参考好答案" | 测试目的 |
| 1-1 | 商务办公 | ... | (生图:参考效果描述)| ... |
| ... |
检查项
- 20 条 Prompt 已就位
- 4 类 × 5 条结构清晰
- 第 3 类"特殊场景"已覆盖至少 5 类短板
- 评测集已锁版本
第四步:定义评分维度
评分维度选择原则
评分维度应反映业务真正关心什么。文本/生图/代码三种场景维度不同,按业务自定义。
通用模板(0-3 分制)
| 维度 | 0 分(不可用) | 1 分(勉强) | 2 分(可用) | 3 分(惊艳) |
| 维度 1 | ... | ... | ... | ... |
| 维度 2 | ... | ... | ... | ... |
| 维度 3 | ... | ... | ... | ... |
| 维度 4 | ... | ... | ... | ... |
AI 生图场景示例
| 维度 | 0 分 | 1 分 | 2 分 | 3 分 |
|---|---|---|---|---|
| 美感 | 丑、杂乱 | 一般 | 精美 | 惊艳 |
| Prompt 还原度 | 完全不沾边 | 沾点边 | 大致还原 | 完美还原 |
| 风格一致性 | 风格全错 | 风格偏 | 大致对 | 风格完美 |
| 商用安全 | 有违规 | 擦边 | 安全 | 完全合规 |
评分人员
每条 Prompt 至少 3 人独立打分(避免单人偏见),分数取均值或多数票。打分人组合建议:
- 1 个 PM(业务理解)
- 1 个业务方(用户视角)
- 1 个内容/设计专员(专业判断)
检查项
- 评分维度 3-5 个,反映业务真正关心的
- 每个维度的 0-3 分有明确定义(不靠感觉)
- 至少 3 人独立打分
- 打分一致性可接受(分数标准差 < 1)
第五步:小规模横向测试
效果对比矩阵
| 题号 | 维度 | 模型A | 模型B | 模型C |
| 1-1 | 美感 | 2 | 3 | 1 |
| 1-1 | 还原度 | 3 | 2 | 1 |
| 1-1 | ... |
| ... |
| 总分(满分=20×维度数×3) | 各模型加权汇总 |
成本分析
| 模型 | 单次调用单价 | 单次生成数量 | 单次成本 | 预计月调用量 | 月成本 |
| A | ¥0.05/次 | 1 张 | ¥0.05 | 100,000 次 | ¥5000 |
| B | ¥0.20/次 | 1 张 | ¥0.20 | 100,000 次 | ¥20000 |
| ... |
综合决策表
| 模型 | 效果总分 | 月成本 | 速度(P95) | 合规风险 | 加权得分 | 排名 |
| A | 95 | ¥5000 | 2s | 低 | 8.5 | 1 |
| B | 110 | ¥20000 | 4s | 中 | 7.0 | 2 |
加权公式按第一步的匹配型确定:
- 速度优先型:效果 30% + 成本 30% + 速度 40%
- 推理优先型:效果 50% + 成本 20% + 速度 30%
- 质量优先型:效果 60% + 成本 20% + 速度 20%
检查项
- 全部 20×N 次测试已跑完
- 效果矩阵 + 成本矩阵 + 综合决策表都已填
- 加权得分排名清晰
- 第一名与第二名的差距已说明(如果接近,要给替补方案)
报告模板
最终交付报告结构:
# 模型选型报告:[场景名称]
## 1. 业务背景
- 场景:____
- 决策影响范围:____(哪个产品/哪些功能)
- 预计上线时间:____
## 2. 需求清单(六维度)
[填表]
## 3. 候选模型池
[3-5 个 + 排除理由]
## 4. 评测方法
- 评测集规模:20 条,分 4 类
- 评分维度:____
- 评分人员:____
## 5. 结果
### 效果对比
[矩阵]
### 成本分析
[表]
### 综合决策
[加权排名]
## 6. 推荐
- 主选模型:____
- 备选模型:____(万一主选挂了能切换)
- 推荐理由:____(业务方能懂的话)
## 7. 风险提示
- 供应商风险:____
- 合规风险:____
- 成本上限假设:____
## 8. 下一步
- POC 阶段:____(接 [POC验证操作指南](/notes/AI%E4%BA%A7%E5%93%81/%E6%93%8D%E4%BD%9C%E6%8C%87%E5%8D%97/POC%E9%AA%8C%E8%AF%81%E6%93%8D%E4%BD%9C%E6%8C%87%E5%8D%97/))
- 上线灰度方案:____(接 [灰度发布](/notes/AI%E4%BA%A7%E5%93%81/%E6%A6%82%E5%BF%B5/%E7%81%B0%E5%BA%A6%E5%8F%91%E5%B8%83/))
常见坑
| 坑 | 后果 | 规避 |
|---|---|---|
| 凭印象列候选模型 | 漏掉真正合适的 | 候选必须从六维度筛 |
| 跳过评测集直接对比 benchmark 分数 | benchmark 与你的业务无关 | 必须用业务真实样本 |
| 评分人只有自己 | 数据有偏见 | 至少 3 人独立打分 |
| 只看效果,不算成本 | 上线后账单爆炸 | 综合决策表是必须项 |
| 没有备选模型 | 主选退役/涨价时被动 | 主选 + 备选成对推荐 |
完成检查清单
报告交付前:
- 六维度需求清单已对齐
- 候选池 3-5 个,排除理由完整
- 评测集 20 条 × 4 类
- 评分维度有 0-3 分明确定义
- ≥3 人独立打分,标准差 < 1
- 效果矩阵 + 成本表 + 综合决策表都完整
- 主选 + 备选成对推荐
- 风险提示有 3 项以上
相关概念
→ 模型选型方法论(五步流程详解) → 模型选型五维度(效果/成本/速度/安全/可控五维评估) → 效果评测体系(评测集与评分方法论) → POC验证(选型后的可行性验证) → POC验证操作指南(选型 → POC 的下一步) → 云厂商与AI基础设施(候选池来源) → AIPM课程 Day5(完整 AI 生图案例参考)