中文

从幻觉到越狱:重新审视大型基础模型的脆弱性

计算机视觉与模式识别 2025-06-02 v1 人工智能 计算与语言

摘要

大型基础模型 (LFM) 容易受到两种不同的脆弱性影响:幻觉和越狱攻击。虽然通常被孤立研究,但我们观察到针对其中一种的防御往往会影响另一种,暗示着更深层的联系。我们提出了一个统一的理论框架,将越狱建模为 token 级优化,将幻觉建模为注意力级优化。在该框架内,我们确立了两个关键命题:(1) \textit{相似损失收敛}——在针对特定目标输出进行优化时,两种脆弱性的损失函数以相似方式收敛;以及 (2) \textit{注意力重分布中的梯度一致性}——两者均表现出由共享注意力动态驱动的一致梯度行为。我们在 LLaVA-1.5 和 MiniGPT-4 上实证验证了这些命题,显示出一致的优化趋势和对齐的梯度。利用这一联系,我们证明针对幻觉的缓解技术可以降低越狱成功率,反之亦然。我们的发现揭示了 LFMs 中共享的失败模式,并建议鲁棒性策略应共同应对这两种脆弱性。

关键词

引用

@article{arxiv.2505.24232,
  title  = {From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models},
  author = {Haibo Jin and Peiyan Zhang and Peiran Wang and Man Luo and Haohan Wang},
  journal= {arXiv preprint arXiv:2505.24232},
  year   = {2025}
}