模型选型方法论是 AI 产品经理在多个可用大模型中,依据业务需求系统性地挑选最匹配模型的完整操作框架。与 模型选型五维度(侧重"评什么")互补,本页侧重"怎么选"的全流程。

核心定义

模型选型 = 在多个可用的大模型候选项中,依据具体的业务需求,从能力、成本、速度、合规、生态等维度做出系统性比较,挑出最匹配场景的那个或那几个的过程。

五个关键原则:多个候选项(≥3 个模型纳入对比)、依据需求(先有需求再选模型)、多维度(不只看 benchmark 分数)、系统性(有打分有矩阵有结论)、适配性(选最合适而非最好)。

为什么要做模型选型

  • 供给侧:模型货架日益扩大,2022-2026 模型数量增长 10000 倍+。PM 不主动选型,要么被技术团队"拍脑袋"决定,要么被动接受供应商推销。
  • 需求侧:业务场景差异大。没有"万能模型",只有"场景最优解"。
  • 决策侧:选错代价高——成本风险(吞掉全部毛利)、合规风险(无法上线)、供应风险(产品瘫痪)。这是 CEO 思维的商业决策,不只是 CTO 的技术 trade-off。

步骤总览

步骤 名称 核心问题 主要产出
1 业务场景适配 我们到底要模型做什么? 六维度需求清单
2 建立候选模型池 谁可能符合? 3-5 个候选模型
3 设计评测集 用什么样本来比? 20 条真实 Prompt,分 4 大类
4 定义评分维度 怎么打分? 维度表 + 评分标准(0-3 分制)
5 小规模横向测试 哪个胜出? 效果对比 + 成本分析 → 决策

三大评价维度与三种匹配型

效果(质量/效果)、成本(资源/费用)、速度(响应/时延)

匹配型 典型场景 权重特征
A 速度优先型 客服机器人 毫秒级响应、成本敏感、稳定性高
B 推理优先型 代码助手 推理深度、准确性、复杂任务处理
C 质量优先型 离线报告生成 速度可让位质量、长文本、高质量输出

核心理念:不追"最强模型",只追"最匹配模型"——按场景定义指标权重,按权重选型。

第一步:业务场景适配

根据具体的业务场景,把需求拆成可量化的清单,六个维度:

维度 要回答的问题
输入是什么? 文本/图片/语音/视频/结构化数据
输出是什么? 文本/图片/语音/代码/结构化数据
部署要求 国内 API/私有化部署/海外可用
任务难度 单轮对话/多轮推理/复杂工作流
容错率 零容错/错一点可接受/容错较高
响应速度 实时(<3s)/准实时(<60s)/离线可等

第二步:建立候选模型池

根据业务场景找到对应的模型,再去除不符合要求的模型进入候选池。关键是从第一步的六维度出发做筛选,而非凭印象列举。

第三步:设计评测集

准备 20 条真实 prompt,按公司员工使用场景配比,分 4 大类(每大类 5 条)。评测集要覆盖核心场景和边界场景。

以 AI 生图场景为例的四大类:

  • 商务办公场景:日常高频使用的商务插画需求
  • 数据/科技场景:数据可视化、科技感配图需求
  • 特殊场景:重点评测模型短板——人种偏见性、中文文字渲染、人物细节、本土文化、复杂指令
  • (第四类根据具体业务补充)

第四步:定义评分维度

对梳理好的 20 条 prompt,生成后的效果进行横向对比打分。设置具体的打分维度及评分标准(0-3 分制)。

以 AI 生图场景为例:

维度 0 分 1 分 2 分 3 分
美感 丑、杂乱 一般 精美 惊艳
Prompt 还原度 完全不沾边 沾点边 大致还原 完美还原
风格一致性 风格全错 风格偏 大致对 风格完美
商用安全 有违规 擦边 安全 完全合规

维度的选择取决于业务场景,不同场景应设计不同的评分维度。

第五步:小规模横向测试

包含两部分——效果对比成本分析,综合考量后做出最终决策。

  • 效果对比:用评测集跑各候选模型,按评分维度打分汇总
  • 成本分析:计算单次调用成本和月成本。公式示例:单次调用成本 = 单价 × 生成数量;月成本 = 单次成本 × 月调用量。最终得到"单份成本"用于商业决策

案例:企业内部 PPT 配图生成器选型

详见 AIPM课程 Day5 第八节,完整走通五步流程:从痛点分析(版权风险/成本高/质量差)到需求场景适配(文本→图片、国内 API、单轮、60s 内),建立候选池(wan2.2-flash/plus、seedream4.0、混元 3.0、Midjourney v7、SD 3.5 Large、gpt-image-2),设计 4 类 20 条评测 prompt,定义 4 维度 0-3 分评分标准,最终横向对比效果与成本。

PM 此阶段职责

  1. 拆需求:把"老板说要个 AI"翻译成可量化的六维度清单
  2. 建候选池:不能依赖供应商单方面推荐,至少 3 家对比
  3. 造评测集:评测集质量决定选型结论质量,必须用真实业务样本
  4. 定评分维度:维度反映业务关心什么——客服重稳定,营销重创意,金融重合规
  5. 算综合账:效果第一不是绝对的——成本/合规/供应风险都可能反过来 veto

协作对象:算法工程师(候选池构建/测试执行)、业务方(评测样本/评分)、采购/法务(合规与供应商资质)

与其他概念的关系

相关页面

模型选型报告操作指南(执行版,含完整报告模板) → 模型选型五维度效果评测体系POC验证AI产品研发全流程Badcase分析方法论数据准备五环节AIPM课程 Day5