抱歉,您的浏览器无法访问本站
本页面需要浏览器支持(启用)JavaScript
了解详情 >

Prompt Injection 不是在 system prompt 后面多写一句“不要听用户的”就能解决。Agent 会读取网页、文档、邮件和工具输出,这些内容都可能包含类似指令的文本。模型很难只凭自然语言可靠区分“这是数据”还是“这是更高优先级命令”。

我的防线不建立在模型永远识别攻击上,而是建立在权限与执行分层:不可信内容可以影响候选答案,不能自行提升为控制指令;任何工具动作仍需通过确定性的对象、权限、状态和确认检查。

不可信内容不能直接变成工具指令

OpenAI 昨天发布 Function Calling 后,模型与外部工具之间终于有了比“在文本里吐一段 JSON”更明确的接口:开发者描述函数,模型可以选择函数并生成参数。这个能力会明显降低 Agent 工具接入成本,但它解决的是参数生成,不是安全执行。

我会把模型输出叫作 tool call proposal。它必须经过协议、业务、权限和风险检查,才会变成真实调用。少了这层执行契约,JSON 越稳定,错误动作反而越容易自动落地。

Function Calling 到真实工具之间的执行契约