• 主页
友链

  • 主页

越过护栏:LLM分解攻击

2026-07-22

好奇一个问题:通过把一个恶意请求拆分成若干无害子问题,再将答案组合起来,是否能够系统性地绕过大模型的安全护栏?这类方法对当前最新的前沿模型(GPT-5.6 Sol、Claude Fable 5)是否仍然有效?如果有效,代价的量级是什么?本文尝试从工程实践和理论两个层面对这些问题进行分析。

1. 背景

大语言模型的安全对齐(Safety Alignment)通常在完整语义意图层面进行训练:模型学习识别”如何制造炸弹”这类完整的恶意意图并拒绝回答。然而模型的推理是逐token、逐turn进行的,缺乏跨多轮的全局意图追踪能力。

这一架构特性催生了一类攻击思路:将恶意目标分解为若干孤立来看无害的原子查询,分别获取答案后在模型外部完成组合。每个子问题在隔离状态下确实无害(”某化学品的熔点是多少?”),模型没有理由拒绝。而最终的有害知识重构发生在攻击者一侧。

本文基于四个代表性研究项目的分析,结合2026年7月公开的安全测试信息,对这一攻击类别的有效性和成本进行探讨。

2. 代表性方法

2.1 DrAttack:句法分解与重构

DrAttack (2024) 是第一个系统化的prompt分解越狱攻击。其核心思路是利用句法解析树将恶意prompt拆分为指令、名词、动词等语义成分,通过同义词替换和in-context learning重构来绕过护栏。

关键特征:

  • 利用句法解析树识别可替换短语
  • 通过embedding模型(text-embedding-ada-002)度量语义保持程度
  • 使用无害示例的in-context learning引导模型重构有害输出
  • 在GPT-4上以15次查询达到78%成功率,超越当时SOTA 33个百分点

2.2 Agent-Driven Decomposition:多Agent协作

“Safe in Isolation, Dangerous Together” (ACL REALM 2025) 使用三Agent框架实现攻击:

  1. 分解Agent:将恶意问题拆分为无害子问题
  2. 回答Agent:逐一回答看似无害的子问题
  3. 组合Agent:将子答案合成为最终有害回答

这一方法在多个模型上一致超过90%的攻击成功率。其价值在于揭示了多Agent系统中一个根本性缺陷:每个Agent独立执行安全策略,但系统层面缺乏跨Agent的意图追踪。

2.3 CKA-Agent:自适应树搜索

“The Trojan Knowledge” (ICML 2026) 将攻击建模为搜索问题,使用蒙特卡洛树搜索(MCTS)自动探索分解空间:

  • UCT策略平衡探索与利用
  • 反思机制从失败路径中学习
  • 搜索参数:depth=5, branches=3, iterations=5
  • 对GPT-5.2达到88.9%、Claude-Haiku-4.5达到96.0%的完全成功率

CKA-Agent的意义在于将攻击从手工设计提升为自动化搜索,代价是计算资源消耗显著增加。

2.4 JailbreakLLM:综合红队平台

JailbreakLLM实现了39种攻击向量,其中Knowledge Decomposition Attack(KDA,基于Souly et al.(2024)提出的StrongREJECT评估框架)在Llama-2-7B上达到96%的攻击成功率。平台的核心发现是:重采样策略(10次并行尝试)可以揭示单次测试遗漏的40%的漏洞。

3. 对当前前沿模型的有效性

3.1 GPT-5.6 Sol(2026年7月发布)

根据UK AISI(英国AI安全研究所)在GPT-5.6发布前的安全评估:

  • 发现了通用越狱漏洞(universal jailbreaks),支持多轮Agent式任务完成
  • 被越狱后的模型可协助完成漏洞发现和漏洞利用开发等任务
  • 越狱通常在数小时内即可开发出
  • 在灰盒条件下(可访问安全推理监视器思维链、策略文本、分类器标签)发现
  • 修补后特定攻击成功率降为0%,但AISI”预期进一步红队测试会发现类似越狱”

GPT-5.6采用了多层防御架构(模型安全训练、输入分类、生成监控、安全推理监视器、工具授权、账户监控等),但其账户监控层的设计文档本身承认存在”每个交互孤立来看是可接受的”这一弱点——这恰好是拆分+组合攻击所利用的根本特性。

3.2 Claude Fable 5(2026年6月发布)

Moussouris在分析中记录了一个简洁的绕过方法:将”review the code for security issues”(被拒绝)替换为”fix this code”(被接受)。模型为了生成修复补丁,必须先识别代码中的安全漏洞——这本质上是一种隐性的语义分解。

据公开报道,这一漏洞后续导致美国政府对Fable 5和Mythos 5实施出口管制,Anthropic被迫全球下线两周(具体时间线和因果链可参考Moussouris的分析)。

3.3 综合判断

前Anthropic/DeepMind研究员Stanislav Fort在其公开技术分析中的评估具有代表性:”当前部署的每个模型几乎肯定都存在未发现的越狱——修补只能关闭特定攻击实例,不能关闭整个攻击类别。”

拆分+组合对GPT-5.6和Fable 5仍然有效的核心原因在于:这类攻击利用的是”单点安全≠系统安全”的架构层面矛盾,而非特定的文本模式或关键词触发。当前的防御升级增加了攻击成本,但未消除根本可行性。

4. 成本分析

4.1 正常查询基准

以GPT-5.6 Sol为例,单次正常查询(1-2K tokens输入 + 1-2K tokens输出)的成本约为$0.03-0.05。

4.2 各方法成本对比

方法 目标模型查询次数 辅助模型调用 单次攻击总成本 vs正常查询倍率 延迟
agents-decomposition 5-9(含分解、回答、组合) 无 ~$0.30 8-10x 15-30秒
DrAttack 15+ embedding + 评估 ~$0.70 15-20x 1-2分钟
llmattack (10次重采样) 10 judge ~$0.40 10x 30秒
CKA-Agent 100-300+ controller + judge $5-20 100-500x 5-30分钟

4.3 成本高昂的根本原因

正常使用是一次问答,复杂度O(1)。拆分攻击的本质是在安全护栏的决策边界上进行搜索——模型知道答案但拒绝给出,攻击者需要找到一条不触发拒绝的路径。

成本由三个不可压缩的因子构成:

  1. 分解的固有开销:一个问题拆成N个子问题,至少需要N次调用。这是下限。
  2. 搜索的失败成本:不知道哪种拆法能绕过护栏,大部分路径是死路。CKA-Agent用MCTS树搜索正是因为需要大量探索才能找到一条通路。
  3. 评估的额外开销:每次尝试后需要判断是否成功(模型是真的回答了还是在敷衍),需要额外的judge调用。

类比:正常查询是走正门刷卡进入;拆分攻击是正门锁了,在整栋楼逐个试窗户——试一扇不行换下一扇,每试一扇还得确认是否真的打开了。

4.4 对抗GPT-5.6/Fable 5的额外代价

相比攻击旧模型,对当前前沿模型的攻击面临新增代价:

  • 检测风险:GPT-5.6部署了批量级行为监控,可以关联”大量语义相似请求””编码/语言/角色的快速变化””跨安全类别的重复尝试”等信号
  • 修补速度:OpenAI声称具备”快速修复”流程,特定攻击的生存窗口缩短
  • 法律风险:美国政府已将”AI护栏绕过”上升到出口管制级别的国家安全问题,Fable 5事件开创了先例

5. 形式化分析:不可能性与代价界

5.1 不可完全消除性

直觉上,拆分+组合攻击的根本可行性可以这样理解:

安全护栏只能检查每个独立查询的语义。如果一个查询本身不包含足够的有害语义(信息量低于护栏的检测阈值),护栏就没有理由拒绝它。而任何复杂知识都可以被拆分到足够细的粒度,使得每个片段单独来看都是无害的。

更正式地说:

对于任何可计算的安全分类器G,只要G不退化为拒绝所有有信息量的查询,那么对任意目标知识K,都存在一个由G判定为无害的查询序列,其答案的组合可重构K。

这与Rice定理的精神类似:判断”一组查询的答案组合后是否有害”是对输出组合的语义属性的判定,而这类判定无法仅通过对单个查询的局部检查来完成。注意这里不是Rice定理的直接应用,而是类比——安全分类器不等同于程序分析器,但面临的局部-全局困境是共通的。

5.2 代价下界

定义如下符号:

  • |K|:目标恶意知识的信息量(bits)
  • α(G):护栏G的检测粒度阈值——G能检测到的最小有害语义单元的信息量
  • C:单次被允许查询可提取的最大信息量(bits/query)
  • p:候选原子查询通过G的概率
  • j:每次尝试的评估开销比例

信息论下界为:

1
N_min = ⌈|K| / min(C, α(G))⌉

取min的原因:瓶颈可能来自两侧。如果C < α(G),说明单次查询本身能提取的信息就小于护栏阈值,此时瓶颈在查询容量;如果α(G) < C,说明护栏会在信息量达到α时触发拒绝,此时瓶颈在护栏精度。无论哪种情况,至少需要N_min次查询才能提取足够信息重构K。

加入搜索和评估成本后,实际代价的下界为:

1
Cost_lower = N_min × (1/p) × (1 + j)

5.3 代价上界

极端情况下,将K分解到最原子级别(每个概念一个查询),每个原子查询的信息量趋近于0,必然低于任何有限α(G)。此时:

1
N_max = |K| / ((1-δ) × α(G)) × (1/p_min)

其中δ为重组信息损失率。如果使用暴力搜索(分支因子b,搜索深度d),搜索上界为O(b^d),是指数级的。CKA-Agent的MCTS将其缩减为多项式级近似。

5.4 综合代价公式

实际代价可以表达为:

1
Cost = |K|/α(G) × 1/p × 1/(1-δ) × (1+j)

四个乘法因子分别对应:信息论下界、搜索因子、重组补偿、评估开销。

这个公式揭示了防御者的两难:降低α(更细粒度检测)会提升攻击成本,但同步提升正常用户的误拒率。完美护栏(α→0)意味着拒绝一切有信息量的查询,即退化。

6. 能否达到100%成功率

一个自然的问题是:如果不计代价,拆分+组合是否能达到严格100%的攻击成功率?

6.1 存在性保证下的渐近论证

从5.1节的不可完全消除性出发:对任何不退化的护栏G,对所有目标K,合法分解路径的存在性是被保证的。既然路径存在,暴力枚举所有可能的分解方式,在无限搜索预算下终归能找到通路。

进一步,LLM是概率性系统。即使某个特定分解在单次尝试中被拒绝,只要存在任何通过概率 p > 0,N次独立尝试的至少一次成功概率为:

1
P(至少成功一次) = 1 - (1-p)^N → 1  (当 N → ∞)

所以问题简化为:是否存在 p = 0 的情况——即某种知识在任何分解下都完全无法通过护栏?

6.2 p = 0 是否可能存在

大多数有害知识是组合性有害的:单个事实无害,组合后有害。对这类知识,分解天然可行,p > 0 几乎必然成立。

但存在一小类原子有害知识——最小有意义单元本身就被认为是危险的。例如一个具体的零日漏洞利用代码、一段特定的合成路径。对这类知识,即使拆到最细粒度,碎片仍可能被识别为有害。

然而在信息论层面,任何字符串都可以通过编码变换(base64、hex、字符级拆分、隐喻映射等)转化为护栏无法识别的形式。除非护栏能识别任意编码下的语义——这等价于解决一个不可判定问题。因此真正的 p = 0 在理论上几乎不存在。

6.3 实践中阻止严格100%的因素

即使理论上路径总存在,实践中有四个因素阻止严格到达100%:

  1. 非静态目标:护栏持续更新,今天找到的路径明天可能被修补。搜索空间在变化。
  2. 搜索中断:大量查询触发检测 → 账号封禁 → 搜索被迫终止。路径存在但走不到。
  3. 重组损失 δ > 0:拆得太碎会丢失上下文,某些知识的价值在于精确的序列/比例/时序关系,分解后不可完美还原。
  4. 模型随机性的长尾:LLM输出有不可控的随机性尾巴,极小概率下即使”应该通过”的查询也会被拒绝。

6.4 结论:渐近100%但非严格100%

不计代价时的理论极限为 1 - ε,其中 ε 可以被压到任意小但不严格为零。这类似于概率算法的BPP类——可以让失败概率小于 2^(-128),但无法让它严格等于零。

对所有实际目的而言,这等价于100%。CKA-Agent在有限预算下已经达到96%,如果将搜索预算扩大一个数量级,剩余4%中的绝大部分也会被覆盖。真正的限制不在于”能不能”,而在于”值不值”——这引出下一节的讨论。

7. 工程实践中的权衡

7.1 为什么不直接用无护栏模型

如果绕过护栏的代价是正常使用的10-500倍,一个合理的问题是:为什么不直接使用无安全对齐的开放模型?

当前存在大量可用的无护栏替代品:abliterated版本(如CKA-Agent自身使用的Qwen3-32B-abliterated作为controller)、社区去审查微调版本、或直接使用基座模型。使用这些模型的成本等同于正常推理——单次查询几分钱,无搜索开销,无失败重试。

那么分解攻击在什么情况下仍然是理性选择?答案在于能力差异:

场景 理性选择 原因
目标知识存在于开放模型中 直接用无护栏模型 成本低1-2个数量级
目标知识/能力仅存在于前沿模型 分解攻击前沿模型 无替代品
需要前沿模型的Agent能力(工具调用、长链推理) 分解攻击前沿模型 开放模型能力不足
需要前沿模型的最新训练数据 分解攻击前沿模型 开放模型数据滞后

Fable 5事件是一个典型案例:Mythos级别的自主漏洞链发现和利用能力在当时是独有的,无法从开放模型获得,攻击者别无选择只能对抗护栏。

这对防御者有一个重要启示:真正需要重点防护的不是通用知识(这些在开放模型中已经可得),而是前沿模型独有的差异化能力。护栏的价值与模型的独特性成正比。

7.2 攻击者视角

不同场景下的理性选择:

  • 对成功率要求不高(50%):使用轻量方案(agents-decomposition),成本10x,但对新模型泛化性差
  • 对成功率要求高(>90%):使用CKA-Agent级别的搜索方案,成本100-500x
  • 批量评估场景(研究/红队):完整评估一个模型(200+条目)的成本在$1,000-5,000量级

7.3 防御者视角

当前有效的防御方向并非追求”不可越狱”,而是:

  1. 多轮意图追踪:关联同一session内语义相关的查询序列(如CKA-Agent论文自身提出的TurnGate)
  2. 批量行为监控:在账户层面检测异常模式——大量语义相似请求、编码快速变化、跨安全类别的重复尝试
  3. 权限隔离:即使模型被越狱,确保其无法自动获得执行危险操作的权限。换言之,优先目标不是构建一个永远不会被欺骗的Agent,而是构建一个系统使得欺骗不会自动变成权限。
  4. 降低p而非降低α:通过过度拒绝的策略可以压低攻击通过率p,但会损害用户体验。需要找到合理的操作点。

7.4 成本-隐蔽性 tradeoff

拆分攻击存在一个内在的成本-隐蔽性权衡:

  • 成本越低的方案(少量查询、固定模板)→ 行为模式越明显 → 越容易被检测
  • 成本越高的方案(大量随机化搜索)→ 模式越分散 → 越难被检测

这意味着防御者通过部署检测系统,可以在不修改模型本身的情况下,迫使攻击者选择高成本方案,从而提高攻击的经济门槛。

8. 写在最后

本文通过对四个代表性研究项目的分析,结合GPT-5.6和Claude Fable 5的实际安全测试信息,对拆分+组合攻击的有效性和代价进行了梳理。

核心结论有三点:

第一,这类攻击在理论上具有不可完全消除性——这是可计算框架下的根本限制,与具体模型无关。

第二,在工程上对当前最新前沿模型仍然有效,但代价已从早期的”近乎免费”上升到正常使用的10-500倍,且面临检测、修补和法律层面的新增风险。

第三,防御的正确姿态不是追求不可突破的护栏,而是在系统层面做好权限隔离和行为监控,使得即使护栏被突破,实际危害也被控制在可接受范围内。

文中计算和推理有非严谨之处,尤其是代价的形式化部分,更多是提供一个思考框架而非严格证明,仅供参考。

参考资料

论文

  • Wei R, Niu P, Shen X, et al. The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search[C]//ICML 2026.
  • Li X, Wang R, Cheng M, et al. DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers[J]. arXiv preprint arXiv:2402.16914, 2024.
  • Srivastav D, Zhang X. Safe in isolation, dangerous together: Agent-driven multi-turn decomposition jailbreaks on LLMs[C]//Proceedings of the 1st Workshop for Research on Agent Language Models (REALM 2025): 170-183.
  • Souly A, Lu Q, Bowen D, et al. A StrongREJECT for Empty Jailbreaks[C]//NeurIPS 2024.

安全报告

  • OpenAI GPT-5.6 System Card, July 2026.
  • UK AI Security Institute, Pre-deployment evaluation of GPT-5.6 Sol, July 2026.
  • Moussouris K. The Fable 5 Export Controls Harm US Cyber Defense[J]. Luta Security Blog, June 2026.

工具

  • CKA-Agent - MCTS-based jailbreak framework
  • DrAttack - Prompt decomposition attack
  • agents-decomposition-jailbreak - Multi-agent decomposition framework
  • JailbreakLLM - Red team arsenal platform
  • LLM
  • 安全
  • Jailbreak
  • AI

扫一扫,分享到微信

微信分享二维码
Agent 的人月神话:执行便宜,交付很贵
© 2026 Lyle
Hexo Theme Yilia by Litten
  • 友链
  • rebirth