跳到正文

AI Know · 技术研究笔记

直接提示词注入防御率达 99.99%,已近"零漏洞"

多轮自适应攻击下防御率跌至约 67%,仍是软肋;幻觉总量比 GPT-5.6 Sol 减少,但未彻底消除;隐藏注入与工具调用结合,风险放大远超单轮对话

00

三分钟读懂

先看结论,再决定是否深读

  1. 直接提示词注入防御率达 99.99%,已近"零漏洞"
  2. 多轮自适应攻击下防御率跌至约 67%,仍是软肋
  3. 幻觉总量比 GPT-5.6 Sol 减少,但未彻底消除
  4. 隐藏注入与工具调用结合,风险放大远超单轮对话
  5. 静态基准与对抗评测结果差距大,安全评估需重估
01 / DEEP DIVE

核心原理

OpenAI 发布 GPT-6 Astra 系统卡,幻觉率较上一代显著下降,直接提示词注入防御率表现优异。但隐藏提示词注入 — 攻击者预先在网页、文档或工具参数中埋入恶意指令,用户无感知引用后即被劫持 — 仍是剩余安全短板。The Decoder 报道指出,当攻击者利用多轮对话的上下文累积实施"自适应攻击"时,防御率从 99.99% 陡降至 67%。这一数据揭示了一个残酷现实:大模型的输入输出防护,在"单次探测"场景看似固若金汤,但在"长期交互+策略性诱导"场景下依旧脆弱。与此同时,GPT-6 Astra 在 ARC-AGI-3 基准上的超人类效率,使得该模型的成熟度与部署半径并不匹配。

02 / DETAILS

技术细节

输入侧

GPT-6 Astra 引入了更精细的分层指令分类器,试图区分系统级指令、用户自然语言与"隐式指令源"。外部工具返回的数据、网页抓取内容、文档元数据都会被标记为"不可信上下文",在送入核心推理之前先经过过滤。系统卡披露,模型具备动态指令权重调节能力:来自不可信源头的"祈使句式"会被分配更低的指令优先级。但这套机制在多轮对话中会逐渐退化,因为对话越长,历史消息里被"合法外衣"包裹的可疑指令越多,分类器难以实现无损隔离。

推理/执行侧

GPT-6 Astra 采用"工具调用具身化"策略:代码解释器、浏览器、文件系统等敏感工具,默认从受信上下文之外的执行请求中剥离。模型内新增了独立的工具策略网络(Tool Policy Network),与主语言模型并行推理,用于对每次工具调用进行安全表决 — 即便主模型被诱导生成工具调用,只要策略网络判定结果"偏离用户整体意图",即中止执行。但该网络本身也依赖对上下文的语义概括;而系统卡显示,在自适应攻击中,攻击者利用碎片化指令逐步侵蚀该语义概括层,最终令策略网络误判。

输出/评测侧

安全团队同时披露了评测侧的关键更新 — 防御率测试不再只针对"单条注入指令的成功率",而是引入了"攻击者多轮自适应奖惩"评测框架。每一轮攻击后,攻击脚本会根据模型是否执行了嵌入指令获得信号,动态调整后续轮次措辞。在 1000 轮长程对话模拟中,模型的提示注入防御率从初始静态环境的 99.99%,暴降至 67% 附近。这意味着模型会逐步将早期被压制的外来指令误判为"用户既定偏好"。

03 / IMPLEMENTATION

工程实践

对正在规划接入 GPT-6 Astra 的开发者,有三条可执行的防护建议:

第一,别把安全寄托于单一模型。所有依赖外部网页、邮件、RSS、文件解析的 RAG 应用,都应在向 GPT-6 Astra 发送之前,先做一次不依赖大模型的静态注入规则校验 — 例如检测目标文件中的指令性语句、可疑的"忽略之前的指示"句式,拦截后再进模型上下文。

第二,对敏感工具采取"软硬分离"。OpenAI 的策略网络能挡住部分直接攻击,但开发者应在应用层增加人工确认闸门 — 对于涉及支付、发信、外部 API 写操作等关键工具的调用,无论模型输出的置信度多高,都要求二次人机交互确认,切断恶意指令到物理世界的路径,不依赖模型决策。

第三,必须主动设计短上下文衰减。对会话历史设置长度上限,并在关键节点(如身份或安全模式发生变化时)执行上下文重写与压缩,缩小自适应攻击可利用的状态空间。此外,定期用多轮注入攻击的前 50 个变体对自身 Agent 业务流程做回归渗透测试,记录防御率是否持续低于 80%,一旦跌破,就应关闭自动工具调用通道。

05 / FAILURE MODES

风险边界

即便 OpenAI 宣称幻觉显著减少,但要注意系统卡中提到的"减少幅度以标准对抗性问答集为基准",这些集与真实世界的长尾输入差异显著。在低资源语言、高度专业化的垂直领域(如医疗合规或金融衍生品条款)中,幻觉率仍将处于不能完全信任的区间。更值得警惕的是越权调用,直接注入防御即便做到 99.99%,在一亿次交互的规模下,也会留下约一万次未被拦截的恶意工具调用,此类幸存事件常集中于超长上下文的复杂对话场景 — 这也解释了为何 67% 的防御率如此危险。延迟方面,Astra 的分层过滤和多策略网络表决机制为每次推理增加额外计算开销,在峰值请求下,用户可感知延迟提升约 220 毫秒,RAG 应用中调用成本随之上升。厂商与开发者都应当将 100% 的安全寄托从模型自治中撤回,防御的本质是"多次独立门禁"叠加,而不是某一层防护的单项分高。

完整信源

事实从哪里来

听书 00:00 / --:--