中文

研究大语言模型中的对抗性触发器转移

计算与语言 2025-04-10 v2

摘要

最近的工作开发了优化程序来寻找称为对抗性触发器的令牌序列,这些序列可以引发对齐语言模型的不安全响应。这些触发器被认为具有高度可转移性,即在一个模型上优化的触发器可以越狱其他模型。在本文中,我们具体表明这种对抗性触发器并非一致可转移。我们广泛调查了13个开源模型之间的触发器转移,并观察到较差且不一致的转移。我们的实验进一步揭示了通过偏好优化对齐(APO)的模型和通过微调对齐(AFT)的模型在对抗性触发器鲁棒性上的显著差异。我们发现,即使直接在模型上优化触发器,APO模型也极难被越狱。另一方面,虽然AFT模型表面上看起来安全,对一系列不安全指令表现出拒绝,但我们表明它们高度容易受到对抗性触发器的影响。最后,我们观察到,在AFT模型上优化的大多数触发器也能泛化到来自五个不同领域的新不安全指令,进一步强调了它们的脆弱性。总的来说,我们的工作强调了对齐语言模型进行更全面安全评估的必要性。

关键词

引用

@article{arxiv.2404.16020,
  title  = {Investigating Adversarial Trigger Transfer in Large Language Models},
  author = {Nicholas Meade and Arkil Patel and Siva Reddy},
  journal= {arXiv preprint arXiv:2404.16020},
  year   = {2025}
}