中文

XBreaking:理解LLM安全对齐如何被打破

密码学与安全 2025-11-10 v3 人工智能 机器学习

摘要

大型语言模型(LLM)是现代以AI解决方案为主导的IT格局中的基本参与者。然而,与之相关的安全威胁可能阻碍其在关键应用场景(如政府组织和医疗机构)中的可靠采用。因此,商业LLM通常经过复杂的审查机制,以消除它们可能产生的任何有害输出。这些机制通过保证模型安全且合乎道德地响应来维护LLM对齐的完整性。作为回应,对LLM的攻击是对此类保护的重大威胁,并且许多先前的方法已经证明了它们在各个领域的有效性。现有的LLM攻击大多采用生成-测试策略来构造恶意输入。为了提高对审查机制的理解并设计有针对性的攻击,我们提出了一种可解释AI解决方案,该方案比较分析审查模型和未审查模型的行为,以推导出独特的可利用对齐模式。然后,我们提出了XBreaking,一种新颖的方法,通过有针对性的噪声注入利用这些独特模式来打破LLM的安全和对齐约束。我们彻底的实验活动返回了关于审查机制的重要见解,并证明了我们方法的有效性和性能。

关键词

引用

@article{arxiv.2504.21700,
  title  = {XBreaking: Understanding how LLMs security alignment can be broken},
  author = {Marco Arazzi and Vignesh Kumar Kembu and Antonino Nocera and Vinod P},
  journal= {arXiv preprint arXiv:2504.21700},
  year   = {2025}
}