On this page8 sections
企业采购 AI 大模型选型 服务时,不应只看排行榜或单次演示效果。真正要判断的是:模型能否匹配业务任务,是否满足中国境内的数据、合规与部署要求,以及供应商能否持续交付。本文将模型原理、应用场景和采购清单连接起来,帮助团队从认知进入决策。
一、先明确模型到底要解决什么
采购前先完成三项定义:
- 业务目标:是智能客服、知识问答、内容生成、代码辅助,还是内部流程自动化?
- 使用对象:员工、客户、开发者或管理者?不同对象对响应速度、权限和交互方式要求不同。
- 成功标准:用准确率、人工节省时间、任务完成率、投诉率或单位调用成本衡量,避免只凭主观体验选型。
二、关键能力指标检查表
1. 任务能力
- [ ] 用真实业务样本测试,而非只看公开案例。
- [ ] 分别验证长文本理解、结构化输出、工具调用、代码和多轮对话。
- [ ] 检查中文、行业术语、方言或专业格式的稳定性。
- [ ] 记录幻觉、漏答、误答和拒答案例,建立可复现测试集。
2. 工程与服务能力
- [ ] 核对接口、兼容协议、并发量、限流规则和可用区域。
- [ ] 确认响应延迟、服务可用性、故障通知和技术支持机制。
- [ ] 比较输入、输出、缓存、批处理及高峰期的计费方式。
- [ ] 明确版本更新、模型下线、接口变更和迁移支持安排。
3. 部署与数据能力
- [ ] 判断公有云、专有实例、私有化部署或混合架构是否适合。
- [ ] 确认数据是否用于训练,日志保存多久,谁可以访问。
- [ ] 检查加密、权限、审计、脱敏、备份和删除机制。
- [ ] 对个人信息、商业秘密和重要数据建立分类处理规则。
三、风险控制清单
- [ ] 由法务、信息安全、业务和技术共同评审供应商。
- [ ] 在合同中写明数据归属、保密责任、违规赔偿和退出机制。
- [ ] 对敏感任务设置人工复核,不让模型直接执行高风险决策。
- [ ] 设计提示词注入、越权访问、恶意文件和错误引用的测试。
- [ ] 保留调用日志、版本记录和结果追踪,便于审计与追责。
- [ ] 预设替代模型、数据迁移方案和服务中断应急流程。
四、供应商比较表
| 维度 | 必问问题 | 证据 |
|---|---|---|
| 效果 | 是否支持真实样本盲测? | 测试记录 |
| 成本 | 总拥有成本如何计算? | 报价与用量模型 |
| 安全 | 数据、权限和审计如何管理? | 合同与安全材料 |
| 交付 | 谁负责集成、培训和运维? | 服务方案 |
| 可持续性 | 版本变化如何通知? | 服务条款 |
公开模型清单和评测页面可用于建立候选池,但不宜替代企业自测,例如 AI大模型排行榜。关于国内外模型认知,可参阅 知乎公开整理的大模型清单 与 主流国内外模型总结;这些页面仅作为检索入口,采购结论仍应以当前官方材料和实测为准。
五、最终决策清单
- [ ] 已定义业务任务、用户、数据边界和验收指标。
- [ ] 至少用同一测试集比较候选模型。
- [ ] 已核算调用、集成、运维和迁移成本。
- [ ] 已完成安全、合规、合同和供应商尽调。
- [ ] 已确定试点范围、负责人、周期和退出条件。
- [ ] 已获得业务、技术、财务与法务共同签字。
