模型网关做成本优化时,最容易比较的是每百万 input/output tokens 单价,然后把简单请求路由到便宜模型。真实 Agent 任务里,便宜模型如果更常生成无效工具参数、需要重试、触发 fallback 或人工接管,最终可能比贵模型花得更多。
我关注 Cost per Verified Success:一类任务从用户请求开始,到业务结果被验证成功,整条路径花了多少钱。失败 attempt、工具调用、检索、基础设施、人工和延迟机会成本都进入分子,不只算最后一次模型账单。
邓明瑞 / 纯粹
模型网关做成本优化时,最容易比较的是每百万 input/output tokens 单价,然后把简单请求路由到便宜模型。真实 Agent 任务里,便宜模型如果更常生成无效工具参数、需要重试、触发 fallback 或人工接管,最终可能比贵模型花得更多。
我关注 Cost per Verified Success:一类任务从用户请求开始,到业务结果被验证成功,整条路径花了多少钱。失败 attempt、工具调用、检索、基础设施、人工和延迟机会成本都进入分子,不只算最后一次模型账单。
Agent 评测最容易从“先造 100 道题”开始。题目通常干净、步骤短、工具永远成功,最后测出一个不错的完成率。生产失败却来自另一套分布:权限刚变化、工具 200 但 body 缺字段、流中途断开、两个同名对象、旧 memory 污染了本轮。
我更愿意从真实失败反向建设评测。每个对用户有影响的 Run,先完成证据归因,再抽成最小可复现场景,脱敏审核后加入固定版本的 regression suite。评测集不是一次性题库,而是系统故障经验的可执行资产。