语言壁垒:剖析多语言语境下 LLM 的安全挑战
计算与语言
2024-01-25 v1 人工智能
摘要
随着大型语言模型(LLM)的影响力跨越全球社区,其在多语言环境中的安全挑战成为对齐研究的首要问题。本文考察了 LLM 在不同语言中面临的安全挑战差异,并讨论了缓解这些问题的方法。通过比较最先进的 LLM 对用高资源语言与低资源语言编写的同一组恶意提示的响应,我们观察到:(1) 当恶意提示用低资源语言编写时,LLM 往往更容易生成不安全响应;(2) LLM 往往对低资源语言的恶意提示生成更多无关响应。为了理解这种差异的来源,我们研究了在 HH-RLHF 数据集上结合人类反馈的强化学习(RLHF)或监督微调(SFT)进行指令微调的效果。令人惊讶的是,尽管使用高资源语言进行训练可以改善模型对齐,但在低资源语言中进行训练却收效甚微。这表明跨语言对齐的瓶颈根源于预训练阶段。我们的发现突出了跨语言 LLM 安全方面的挑战,我们希望它们能为该方向的未来研究提供参考。
引用
@article{arxiv.2401.13136,
title = {The Language Barrier: Dissecting Safety Challenges of LLMs in Multilingual Contexts},
author = {Lingfeng Shen and Weiting Tan and Sihao Chen and Yunmo Chen and Jingyu Zhang and Haoran Xu and Boyuan Zheng and Philipp Koehn and Daniel Khashabi},
journal= {arXiv preprint arXiv:2401.13136},
year = {2024}
}