中文

多语言混合:基于语言混合的 LLM 安全对齐评估

计算与语言 2024-07-11 v1

摘要

由于安全性在整个大语言模型(LLM)开发生命周期中仍然是一个关键问题,研究人员和工业界从业者越来越关注保护 LLM 行为并使其与人类偏好和伦理标准对齐。LLM 在广泛的多语言语料库上训练,展现出跨不同语言和领域的强大泛化能力。然而,当前的安全对齐实践主要关注单语言场景,这使得它们在复杂的多语言环境(尤其是复杂的混合语言格式)中的有效性在很大程度上未被探索。在本研究中,我们引入了 Multilingual Blending,这是一种混合语言的查询-响应方案,旨在评估各种 state-of-the-art LLM(例如 GPT-4o、GPT-3.5、Llama3)在复杂多语言条件下的安全对齐。我们进一步调查了可能影响 Multilingual Blending 在破坏 LLM 安全防护有效性的语言模式,如语言可用性、形态学和语系。我们的实验结果表明,在没有精心制作的提示模板的情况下,Multilingual Blending 显著放大了恶意查询的危害,导致 LLM 安全对齐中的绕过率急剧增加(GPT-3.5 上为 67.23%,GPT-4o 上为 40.34%),远超单语言基线。此外,Multilingual Blending 的性能因内在语言特性而显著不同,具有不同形态学和来自不同语系的语言更容易规避安全对齐。这些发现强调了在复杂的多语言环境中评估 LLM 并制定相应安全对齐策略的必要性,以与其卓越的跨语言泛化能力相匹配。

关键词

引用

@article{arxiv.2407.07342,
  title  = {Multilingual Blending: LLM Safety Alignment Evaluation with Language Mixture},
  author = {Jiayang Song and Yuheng Huang and Zhehua Zhou and Lei Ma},
  journal= {arXiv preprint arXiv:2407.07342},
  year   = {2024}
}