“模型没有返回结果”是一句症状,不是根因。我见过模型已经正常结束,网关漏了 terminal event;也见过前端展示了答案,服务端却没有持久化。只看其中一层,谁都能拿出一段日志证明自己没问题。
Agent 诊断需要的是可连接、可校验的证据链。它从用户实际看见的结果出发,关联到 Run、上下文、模型 Attempt、工具 Operation、流事件和最终存储,并明确哪一段是原始事实、哪一段是系统推断。
邓明瑞 / 纯粹
“模型没有返回结果”是一句症状,不是根因。我见过模型已经正常结束,网关漏了 terminal event;也见过前端展示了答案,服务端却没有持久化。只看其中一层,谁都能拿出一段日志证明自己没问题。
Agent 诊断需要的是可连接、可校验的证据链。它从用户实际看见的结果出发,关联到 Run、上下文、模型 Attempt、工具 Operation、流事件和最终存储,并明确哪一段是原始事实、哪一段是系统推断。
RAG 产品加上“参考资料”区域后,答案看起来会可信很多。实际抽查时经常发现:链接确实相关,却没有支持模型写出的数字;文档说的是测试环境,答案扩展到了生产;三条引用里两条互相冲突,模型选了表达最顺的一条。
引用是展示形式,证据关系才是可验证结构。我会在最终答案前增加 Evidence 层:先拆出可核查 claim,再把每个 claim 与具体 source/version/span 对齐,标注支持、冲突或不足,最后由发布策略决定保留、降级措辞或拒答。