中文

多语言协同防御大语言模型

计算与语言 2025-09-16 v2 人工智能

摘要

大语言模型 (LLM) 的鲁棒性与安全性已成为突出的研究领域。一个突出的漏洞是,通过将有害查询翻译成稀有或不充分代表的语言来绕过 LLM 安全措施,这是一种简单而有效的“劫持”这些模型的方法。尽管关注日益增长,但针对多语言场景的安全护卫研究仍有限,凸显了增强多语言安全性的紧迫需求。在本工作中,我们调查了不同语言之间各种攻击特征之间的相关性,并提出一种新的学习方法,即多语言协同防御 (Multilingual Collaborative Defense, MCD),以自动优化一个连续、柔软的安全提示词,促进 LLM 的多语言护卫。MCD 方法具有三个优势:首先,它有效地提高了跨多语言的护卫性能。其次,MCD 在保持强泛化能力的同时最小化错误拒绝率。最后,MCD 缓解了由 LLM 训练语料不平衡导致的语言安全错位。在评估 MCD 效果方面,我们手动构建了常见 jailbreak 基准测试(如 MaliciousInstruct 和 AdvBench)的多语言版本,以评估各种护卫方法。此外,我们将这些数据集引入不充分代表的语言,以验证 MCD 的语言迁移能力。结果表明,MCD 在对抗多语言劫持尝试方面超越了现有方法,同时也表现出强大的语言迁移能力。我们的代码已公开:https://github.com/HLiang-Lee/MCD。

关键词

引用

@article{arxiv.2505.11835,
  title  = {Multilingual Collaborative Defense for Large Language Models},
  author = {Hongliang Li and Jinan Xu and Gengping Cui and Changhao Guan and Fengran Mo and Kaiyu Huang},
  journal= {arXiv preprint arXiv:2505.11835},
  year   = {2025}
}

备注

21 pages, 4figures