本文目录12 个章节
这是一份面向中国研究者、企业用户与开发者的国内外大模型选型 Checklist。它不以单一排行榜名次作为结论,而是先回答“有哪些、怎么分类、适合什么任务”,再进入成本、合规与采购决策。
一、先建立模型生态全景
按来源分类
- 国内模型:重点考察中文理解、中文生成、国产云与本地部署适配,以及中国监管环境下的数据处理能力。
- 国外模型:重点考察多语言、代码、复杂推理、国际化产品集成和跨区域服务能力。
- 开源或开放权重模型:可获得权重或较完整的运行能力,便于私有化、微调和深度定制,但需要自行承担算力、工程维护与安全治理。
- 闭源或 API 模型:由服务商托管,接入速度较快,通常具备稳定的产品体验,但受调用政策、价格、接口变化和数据边界影响。
“开源”并不必然等于完全免费或无限制使用。采购时应核对许可证、商用范围、权重开放程度、训练数据说明、衍生模型义务及安全责任边界。
按能力与任务分类
- 通用对话模型:适合问答、写作、摘要、知识辅助和办公协作。
- 推理模型:适合复杂分析、规划、数学、代码审查和多步骤决策。
- 代码模型:适合补全、重构、测试生成、文档生成和研发助手。
- 多模态模型:处理文本、图片、音频或视频,适合质检、票据、客服和内容生产。
- 长上下文模型:适合合同、制度、技术资料和多文档分析,但要验证长文本中的准确率。
- 行业模型或垂直方案:可能更贴近金融、制造、医疗、政务等流程,但必须审查专业责任与数据合规。
二、采购前能力核验清单
1. 明确业务问题
- [ ] 写出具体任务,而不是只写“采购一个 AI 大模型”。
- [ ] 记录用户、输入、输出、频率和可接受响应时间。
- [ ] 区分知识问答、内容生成、流程自动化、预测分析和决策支持。
- [ ] 标注哪些输出可以人工复核,哪些输出会直接影响客户、员工或生产系统。
- [ ] 规定成功标准,例如准确性、引用完整性、拒答质量、格式遵循率和人工节省时间。
2. 建立候选矩阵
- [ ] 记录模型来源、供应商、版本、接口形式和可用区域。
- [ ] 标注闭源 API、开放权重、私有化部署或混合部署。
- [ ] 记录上下文长度、结构化输出、工具调用、多模态和批处理能力。
- [ ] 区分基础模型、推理模型、代码模型与行业方案,避免比较不同类别。
- [ ] 为每个候选模型安排相同的真实业务测试集。
不要只看公开排行榜。排行榜适合发现候选对象,但未必覆盖企业的中文术语、内部格式、敏感数据和实际延迟。可将AI大模型排行榜作为线索来源,再用自有数据验证。
3. 验证质量与稳定性
- [ ] 使用脱敏的真实样本,覆盖正常输入、歧义输入、长文档和边界案例。
- [ ] 分别测试事实性、推理、中文表达、代码质量、引用能力和幻觉风险。
- [ ] 统计失败类型,而不仅是平均分;尤其关注高风险任务的最差表现。
- [ ] 测试高峰期延迟、限流、超时、重试和服务中断后的行为。
- [ ] 验证版本升级是否改变输出格式、工具调用和安全策略。
- [ ] 检查模型是否能稳定遵循系统提示、权限范围和业务规则。
三、成本与工程适配清单
- [ ] 计算输入、输出、缓存、批处理、微调、向量检索和存储成本。
- [ ] 将调用费用换算为单任务、单用户和月度总成本。
- [ ] 把算力、显存、运维、监控、网络和备份纳入自部署总成本。
- [ ] 比较 API 接入、私有化部署、混合路由和多模型备用方案。
- [ ] 确认 SDK、网关、日志、流式输出、函数调用与企业身份认证能力。
- [ ] 评估现有数据平台、知识库、工作流和权限系统的改造量。
- [ ] 预留模型替换接口,避免业务逻辑与单一供应商深度耦合。
四、数据、安全与合规清单
- [ ] 明确输入数据是否包含个人信息、商业秘密、重要数据或受监管数据。
- [ ] 确认数据是否用于训练、评估、人工标注或服务改进。
- [ ] 核对数据存储地点、跨境传输、保留期限、删除机制和备份策略。
- [ ] 要求供应商说明访问控制、加密、审计日志、漏洞响应与事件通报。
- [ ] 对开源模型核查许可证、模型卡、已知风险、依赖组件和供应链来源。
- [ ] 对输出建立人工复核、敏感词控制、事实核验和责任追踪机制。
- [ ] 为提示词注入、越权调用、数据泄露、恶意文件和不当内容设计测试。
- [ ] 让法务、信息安全、业务负责人共同签署上线边界,而非由采购单独决定。
五、合同与供应商尽调清单
- [ ] 写明服务等级、可用性、响应时间、限流规则和故障赔偿。
- [ ] 约定价格调整、版本变更、接口废弃和提前通知期限。
- [ ] 明确知识产权、输入归属、输出使用权和侵权责任分配。
- [ ] 要求提供导出、迁移、日志保留和终止服务后的数据删除机制。
- [ ] 确认供应商是否允许商业使用、转售、嵌入产品或跨客户调用。
- [ ] 核实实际签约主体、数据处理主体、分包商及技术支持地点。
- [ ] 评估供应商的财务稳定性、生态成熟度与长期维护能力。
六、最终决策表
为每个候选模型按业务权重评分:
| 维度 | 建议问题 |
|---|---|
| 任务质量 | 是否解决核心任务,失败是否可控? |
| 数据边界 | 能否满足中国业务的数据与合规要求? |
| 部署方式 | API、私有化或混合模式是否匹配? |
| 总成本 | 三年成本是否包含工程和运维? |
| 稳定性 | 延迟、限流、版本变化是否可接受? |
| 可替代性 | 是否保留第二供应商与迁移路径? |
| 供应商 | 合同、支持、生态和责任是否清晰? |
当高风险任务无法人工复核时,应优先选择可审计、可控、可迁移的方案,而不是单纯追求最高分。
七、采购结论前的最后确认
- [ ] 是否至少保留一个备选模型或供应商?
- [ ] 是否用真实脱敏数据完成小规模试点?
- [ ] 是否记录了质量、成本、延迟和风险基线?
- [ ] 是否完成法务、安全、业务和技术联合评审?
- [ ] 是否定义上线、暂停、回滚和退出条件?
- [ ] 是否把模型版本、提示词、评测集和监控纳入持续治理?
