中文

理解多语言 LLM 免微调攻击的脆弱性

计算与语言 2025-03-03 v2 人工智能 密码学与安全 机器学习

摘要

最近在大型语言模型(LLMs)方面的进展引发了对其安全性的广泛关注。近期研究表明,LLM的安全对齐可以通过仅使用少量恶意挑选的指令-following 示例进行的微调即可被轻易移除,即所谓的微调攻击。我们进一步一步探讨多语言 LLM中的微调攻击。我们首先发现微调攻击的跨语言泛化:使用一种语言中的少量恶意挑选的指令-following 示例,多语言 LLM也容易被破坏(例如,多语言 LLM 在其他语言中无法拒绝有害提示)。鼓励这一发现,我们假设与安全相关的信息是 language-agnostic 的,并提出了一种新方法,称为 Safety Information Localization(SIL),以识别模型参数空间中的 safety 相关信息。通过SIL,我们验证了这一假设,发现仅改变微调攻击中20%的权重参数即可在所有语言中破坏安全对齐。此外,我们提供了证据支持另一条备选路径假设,即冻结 safety 相关参数并不能防止微调攻击,我们演示了我们的攻击向量仍可用于jailbreak适用于新语言的 LLM。

关键词

引用

@article{arxiv.2410.18210,
  title  = {Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks},
  author = {Samuele Poppi and Zheng-Xin Yong and Yifei He and Bobbie Chern and Han Zhao and Aobo Yang and Jianfeng Chi},
  journal= {arXiv preprint arXiv:2410.18210},
  year   = {2025}
}

备注

15 pages, 6 figures, 7 tables