模型选型 = 根据业务场景的需求,选择"最合适"(不是最强大)的大模型作为AI产品的能力底座,在效果/成本/速度/安全/可控性之间做出最优权衡的过程。
本页侧重"评什么"——五个评估维度本身;完整的"怎么选"五步流程见 模型选型方法论。
类比买车:没有"最好的车",只有"最适合你场景的车"——模型也一样。
核心认知:模型选型不是技术决策,是"业务 × 技术 × 成本"的三方平衡。PM必须深度参与(懂业务、懂效果、懂成本)。
五个核心评估维度
- 效果维度:准确率、推理能力、多语言、上下文长度
- 成本维度:单token价格、月度调用总量、微调/部署成本、边际成本
- 速度维度:响应延迟、并发能力、首字延迟、TPS吞吐
- 安全维度:数据隐私、内容合规、出海合规、行业资质
- 可控维度:私有部署、模型微调、版本锁定、响应格式
主流模型对比(2025年参考)
| 模型 | 效果 | 成本 | 速度 | 中文支持 | 适合场景 |
|---|---|---|---|---|---|
| Claude Opus | ★★★★★ | ★★ | ★★★ | ★★★★ | 复杂推理/Agent |
| Claude Sonnet | ★★★★ | ★★★★ | ★★★★ | ★★★★ | 通用主力(推荐) |
| Claude Haiku | ★★★ | ★★★★★ | ★★★★★ | ★★★ | 高并发/低成本 |
| GPT-5 | ★★★★★ | ★★ | ★★★ | ★★★★ | 复杂推理/创作 |
| GPT-4o-mini | ★★★ | ★★★★★ | ★★★★★ | ★★★ | 简单分类/翻译 |
| Gemini | ★★★★ | ★★★★ | ★★★★ | ★★★ | 多模态/长文档 |
| DeepSeek-V3 | ★★★★ | ★★★★★ | ★★★★ | ★★★★★ | 国内业务/性价比 |
| 通义千问 | ★★★★ | ★★★★ | ★★★★ | ★★★★★ | 阿里云生态/合规 |
| Llama 3.3 | ★★★ | ★★★★★ | ★★★★ | ★★★ | 私有化/数据敏感 |
数据每3-6月会变,选型前必须重新评测。维度优先级会因场景变化(同一产品可能有不同选择):
- 客服机器人:速度>成本>效果
- 法律合同审查:效果>安全>成本
- 营销文案生成:效果>速度>成本
- 海量内容审核:成本>速度>效果
- 医疗辅助诊断:安全>效果>速度
选错的代价
- 选太强:每月API账单¥50万,但准确率只比便宜模型高3%
- 选太弱:准确率不够,用户流失、口碑崩盘
- 选错类型:用文本模型做图片识别,根本跑不通
- 选错部署方式:医疗数据用云端API,合规事故
PM核心心法:先问"业务最在乎什么",再倒推"模型怎么选"。
模型服务商分类
- 自研+直营(第一方官方):API自己卖,如OpenAI、Anthropic、Gemini、DeepSeek等
- 自研+分销(第一方云市):模型官方训练,通过云厂商货架售卖,如Azure OpenAI、AWS Bedrock、阿里云百炼市场、华为云MaaS、火山方舟
- 开源+托管(第三方托管):基于LLaMA/ChatGLM/Qwen提供托管或一体机,如新华、浪潮、京东云"言犀"
PM 怎么用 / 何时用
- 选型评审时,用五维度(效果/成本/速度/安全/可控)做候选模型打分表,避免只看"效果"拍脑袋。
- 当业务对延迟或单次成本敏感时,先用"速度/成本"两维度划掉不达标的,再在剩下的比效果。
- 私有化/合规场景,"安全/可控"是一票否决项,优先于效果;选型前先回答"业务最在乎什么",再倒推模型。
相关页面
→ AIPM课程 Day2 → POC验证 → 中国AI产业图谱 → 效果评测体系 → AI工程集成