🎯 每百万Token价格只能说明模型调用单价。企业真正要追踪的是:有多少任务达到质量标准、完成这些任务花了多少钱、结果是否可靠,以及产出能否比成本增长得更快。

同一个任务,便宜模型可能要调用五次并由人工返工,昂贵模型可能一次完成。只看Token账单,很容易把低单价误判成低成本。
OpenAI提出“Useful Intelligence per Dollar”,核心也是把衡量对象从Token转回工作结果。这是供应商提出的框架,企业仍要用自己的任务、质量门槛和工资成本验证。
📌 Token单价漏掉了什么
一项AI任务的真实成本通常包含:
| 成本项 | 常见来源 |
|---|---|
| 模型调用 | 输入、输出、推理、缓存和多模态Token |
| 工具调用 | 搜索、数据库、浏览器、沙箱、OCR和第三方API |
| 重试 | 429、超时、工具失败、格式错误和模型自我修正 |
| 人工审核 | 事实核对、代码Review、法律审批和结果录入 |
| 返工 | 错误输出导致重新执行、回滚或客户补偿 |
| 基础设施 | 日志、向量库、存储、网络、监控和安全过滤 |
| 延迟 | 用户等待、队列阻塞和业务机会损失 |
Google Cloud的AI总拥有成本说明同样把Serving、训练、存储、应用层、监控和工程维护分开。模型账单只是其中一项,生产团队的维护时间有时更贵。
🧮 成功任务成本怎么计算
先定义“成功”。客服场景可以是问题解决且不需要二次转人工;代码场景可以是测试通过并完成Review;合同场景可以是关键条款识别准确并保留证据引用。
成功任务成本 = 全部运行成本 ÷ 达标任务数
全部运行成本建议按以下公式统计:
模型费用
+ 工具与基础设施费用
+ 人工审核工时 × 人力单价
+ 失败任务的重试与返工费用
+ 事故、回滚和客户补偿成本
例子:一个月处理1000个任务,模型和工具花费1000美元,人工审核3000美元,返工1000美元。最终800个任务达标:
成功任务成本 = 5000 ÷ 800 = 6.25美元
换成便宜模型后API费用降到600美元,但达标任务降至650个,人工审核与返工升到4400美元:
成功任务成本 = 5000 ÷ 650 ≈ 7.69美元
API账单下降了,业务单位成本反而上升。
📊 四项记分卡怎么建

OpenAI的官方框架提出四个问题,可以改造成企业内部记分卡:
| 维度 | 应记录的指标 |
|---|---|
| 有效工作 | 达标任务数、节省工时、实际完成的业务动作 |
| 成功成本 | 每个达标任务的模型、工具、人工和返工成本 |
| 可靠程度 | 一次成功率、事实错误率、升级人工率、回滚率 |
| 规模价值 | 产出增长率、总成本增长率、峰值可用性 |
OpenAI还建议在Agent评估中记录Turns、Tokens、Attempts、Retries、Wall-clock Time和Expected Cost per Successful Solve。Anthropic的Agent评估指南则强调,必须验证环境中的真实结果,不能只看Agent在回复里声称“已经完成”。
一套有效评测至少包含:
- 固定的真实任务集;
- 明确的通过条件;
- 代码、模型和人工三类评分;
- 工具调用和最终状态验证;
- 每次模型、提示词和路由变更后的回归测试。
⚙️ 模型路由比统一换模型更有效
所有任务都用最强模型,成本高且延迟大;所有任务都用最便宜模型,容易增加失败和返工。更合理的方式是按风险和复杂度分层。
| 任务 | 路由思路 |
|---|---|
| 分类、提取、格式转换 | 小模型或确定性代码 |
| 普通问答与摘要 | 中档模型,设置证据要求 |
| 长周期代码和研究 | 强推理模型,限制步骤和预算 |
| 金融、法律、支付操作 | 强模型 + 工具验证 + 人工审批 |
| 批量离线任务 | Batch、低优先级或延迟执行 |
路由决策也要进入评测。某个小模型在分类任务上达标,就没有必要为每次请求支付前沿推理成本;某个复杂任务反复失败时,直接升级模型可能比继续重试便宜。
站内的9Router多模型网关指南 可用于统一模型名、密钥、回退和路由。需要补充独立API上游时,可查看APIMart模型入口 ,具体价格与可用模型以实时页面为准。
🛠️ 降成本先处理失败循环
Agent成本失控常来自重复上下文和无边界重试。一个工具调用失败后,模型可能重新读取完整会话、改变参数并再次尝试,每次都消耗Token和时间。
生产系统应设置:
- 每个工具的最大重试次数;
- 整个任务的Token、步骤和时间预算;
- 429错误的Retry-After与指数退避;
- 连续同类错误的Circuit Breaker;
- 无法继续时返回部分结果并升级人工;
- 对旧工具输出做裁剪和摘要;
- 对稳定前缀使用官方缓存机制。
上下文越长,重试越贵。日志需要区分“用于成功任务的Token”和“失败、循环、无效搜索消耗的Token”,否则团队只能看到总账单,看不到浪费发生在哪里。
❓ 常见问题
最便宜的模型什么时候最划算?
任务简单、质量门槛明确、可以自动验收且失败成本低时。分类、字段提取和批量格式转换通常适合小模型。
人工审核时间怎么折算?
记录每类任务平均审核分钟数,乘以包含薪酬和管理成本的小时单价。不同岗位应分开计算。
成功率多高才可以上线?
没有通用数字。低风险文案可以容忍人工修改,支付、交易、医疗和法律任务需要更严格的质量、权限和升级机制。
应该每月还是每天统计?
费用与错误率可以每日监控,业务ROI按周或月观察。模型升级和提示词变更后,应立即跑同一套回归任务。
Token越少一定越好吗?
Token减少只有在质量、可靠性和任务完成率保持时才有价值。过度压缩上下文可能降低准确率,最终增加重试和返工。
