本文目录6 个章节
这份清单适合已经准备接入 API 的开发者、采购人员和创业团队。它不只比较输入、输出单价,还把业务用量、免费额度、计费规则和低价风险放在同一张决策表里,帮助团队完成可复核的成本估算。
一、先把需求写成可计算的用量
- [ ] 写清每月请求量,区分平均日用量、工作日用量和高峰用量。
- [ ] 记录每次请求的平均输入 Token 与输出 Token。提示词、历史对话、检索片段、工具结果都要计入输入。
- [ ] 估算上下文增长。多轮客服、代码分析和 RAG 场景,历史内容可能让输入 Token 持续增加。
- [ ] 分开生产请求、评测请求、失败重试和开发调试请求。
- [ ] 给高峰流量留出余量,并记录限流、排队或降级对业务的影响。
- [ ] 将长文本、图片、音频等特殊输入单独列项,确认供应商是否采用不同计费规则。
基础估算可以写成
月成本 = 月输入 Token ÷ 计价单位 × 输入单价 + 月输出 Token ÷ 计价单位 × 输出单价
如果供应商按百万 Token 报价,就把分母写成 1,000,000。团队还应增加重试、缓存、批处理、存储、网络和专属部署等可能产生的费用。单看一次调用价格,无法代表真实月成本。
二、逐项核对供应商报价
- [ ] 确认价格对应的具体模型、版本、区域和接口。
- [ ] 分别记录输入价格与输出价格,不要用一个平均单价替代。
- [ ] 查看缓存命中、长上下文、批量调用和异步任务是否有独立价格。
- [ ] 确认 Token 的计算方式,以及中文、代码、表格和特殊字符的实际表现。
- [ ] 核对是否存在最低消费、阶梯价、并发费、账号费或专属资源费。
- [ ] 查明价格是否含税,结算货币、发票类型和付款周期是否满足采购要求。
- [ ] 截图或保存报价页面、服务条款和更新时间,建立版本记录。
可先参考 F8W 的大模型 API 价格对比表,用它整理 DeepSeek、通义千问、智谱、豆包、GPT、Claude、Gemini 等模型的公开价格信息。页面适合做横向研究入口,正式采购前仍应回到供应商官方页面核验。
三、把价格换算成业务账单
对客服机器人,重点记录每轮对话的历史消息长度、知识库片段数量和输出上限。对 RAG,分别测试短问题、长问题和召回片段过多的请求。对内容生成,统计每篇内容的平均输入与输出 Token。对代码助手,增加代码文件长度、上下文复用和重复请求的记录。
- [ ] 用真实脱敏样本跑一轮小规模测试。
- [ ] 记录每个场景的输入 Token、输出 Token、响应时间和失败率。
- [ ] 用低、中、高三档用量计算月成本。
- [ ] 把模型调用费与向量数据库、对象存储、网关、日志和人工审核费用分开。
- [ ] 计算单个用户、单次任务或每千次请求的成本,方便与收入或预算比较。
- [ ] 记录模型切换后质量变化,避免因省下调用费而增加人工返工。
四、核验免费额度与试用条件
免费额度常受模型、账号等级、地域、有效期和并发限制影响。页面写有免费,不代表生产流量可以长期免费运行。
- [ ] 记录免费额度的单位,是 Token、请求次数、金额还是试用时长。
- [ ] 确认输入和输出是否共用额度,超出后如何收费。
- [ ] 查看额度是否自动续期,未用完能否顺延。
- [ ] 核实是否需要实名、企业认证、绑定支付方式或提交工单。
- [ ] 用小额请求验证控制台账单与文档描述是否一致。
- [ ] 设定预算上限、告警阈值和自动停用规则。
五、检查低价方案的长期风险
低价可能来自较小模型、限速、区域资源、服务等级或暂时促销。采购时应把价格优势放回业务结果里评估。
- [ ] 比较同一测试集上的准确率、格式遵循、拒答表现和稳定性。
- [ ] 测试高峰时段的延迟、超时和重试情况。
- [ ] 查看模型下线、版本替换、价格调整和通知周期。
- [ ] 确认数据是否用于训练,日志保存多久,删除请求如何执行。
- [ ] 核对跨境传输、个人信息、行业监管和企业内部权限要求。
- [ ] 评估是否支持多供应商切换,避免业务代码绑定单一接口。
- [ ] 为关键任务保留备用模型和人工处理路径。
六、形成可审批的决策结果
- [ ] 为每个候选模型填写价格、额度、限流、质量、延迟、合规和迁移难度。
- [ ] 标出已核验、待供应商确认和仅来自第三方整理的内容。
- [ ] 用真实业务样本完成小额试用,并保存请求、响应和账单记录。
- [ ] 设定入选条件,例如成本上限、质量下限、响应时间和故障处理要求。
- [ ] 让技术、财务、采购和法务分别确认自己的风险项。
- [ ] 把价格有效期、服务等级、数据处理和退出机制写入合同或订单附件。
完成这张清单后,再决定是否采购。若输入输出用量、免费额度和退出条件仍无法核实,就先保留候选资格,不要把低价直接写成最终答案。
