模型网关做成本优化时,最容易比较的是每百万 input/output tokens 单价,然后把简单请求路由到便宜模型。真实 Agent 任务里,便宜模型如果更常生成无效工具参数、需要重试、触发 fallback 或人工接管,最终可能比贵模型花得更多。
我关注 Cost per Verified Success:一类任务从用户请求开始,到业务结果被验证成功,整条路径花了多少钱。失败 attempt、工具调用、检索、基础设施、人工和延迟机会成本都进入分子,不只算最后一次模型账单。
邓明瑞 / 纯粹
模型网关做成本优化时,最容易比较的是每百万 input/output tokens 单价,然后把简单请求路由到便宜模型。真实 Agent 任务里,便宜模型如果更常生成无效工具参数、需要重试、触发 fallback 或人工接管,最终可能比贵模型花得更多。
我关注 Cost per Verified Success:一类任务从用户请求开始,到业务结果被验证成功,整条路径花了多少钱。失败 attempt、工具调用、检索、基础设施、人工和延迟机会成本都进入分子,不只算最后一次模型账单。
多接几家模型后,网关很容易加一条“失败就切下一个”的逻辑。它能缓解单供应商不可用,却不是完整路由:备用模型可能不支持 function calling、上下文不够、数据地域不合规,或者虽然 HTTP 成功,业务输出已经无法使用。
我把路由分成两步。先用硬约束过滤出“有资格执行”的模型,再在候选中按具体任务的成功率、延迟和成本选择。fallback 也必须重新通过硬约束,不能为了可用性把安全与能力要求降掉。