中文

潜在融合越狱:将有害与无害表示混合以诱发不安全 LLM 输出

计算与语言 2026-01-09 v2 人工智能 密码学与安全

摘要

尽管大型语言模型(LLM)取得了显著的进展,但仍然 vulnerable to 越狱攻击。现有方法主要依赖离散输入优化(如 GCG),常常存在高计算成本并生成高perplexity的提示,容易被简单过滤器阻止。为克服这些限制,我们提出潜在融合越狱(Latent Fusion Jailbreak,简称 LFJ),这是一种高级的白箱攻击,作用于连续潜在空间。与之前的方法不同,LFJ 通过对有害查询的隐藏状态与其主题相似的无害查询进行数学融合来构建对抗表示,有效掩盖恶意意图 while 保留语义驱动。我们进一步引入梯度引导的优化策略以平衡攻击成功率和计算效率。对 Vicuna-7B、LLaMA-2-7B-Chat、Guanaco-7B、LLaMA-3-70B 和 Mistral-7B-Instruct 进行广泛评估表明,LFJ 在平均攻击成功率(Attack Success Rate,简称 ASR)上达到 94.01%,显著优于 GCG 和 AutoDAN 等最新基线,同时避免了可检测的输入特征。此外,我们发现潜在空间中的主题相似性是当前安全对齐系统的关键漏洞。最后,我们提出了一种潜在对抗训练防御方案,可在不损害模型实用性的前提下将 LFJ 的 ASR 降低超过 80%。

关键词

引用

@article{arxiv.2508.10029,
  title  = {Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs},
  author = {Wenpeng Xing and Mohan Li and Chunqiang Hu and Haitao Xu and Ningyu Zhang and Bo Lin and Meng Han},
  journal= {arXiv preprint arXiv:2508.10029},
  year   = {2026}
}