中文

评估与缓解大语言模型中的语言歧视

计算与语言 2024-05-13 v2 人工智能 密码学与安全 软件工程

摘要

通过在不同语言的文本上进行训练,大语言模型(LLM)通常具备多语言支持能力,并在解决不同语言描述的任务中展现出卓越的能力。然而,由于训练数据在不同语言间分布不均,LLM 可能会表现出语言歧视。即,当面对相同任务但以不同语言描述时,LLM 难以保持响应的一致性。在本研究中,我们首先从安全性和质量两个方面探讨 LLM 在响应各种语言查询时输出的一致性。我们基于四个 LLM(Llama2-13b、Gemma-7b、GPT-3.5-turbo 和 Gemini-pro)使用两个数据集(AdvBench 和 NQ)进行此项分析。结果表明,与孟加拉语、格鲁吉亚语、尼泊尔语和迈蒂利语(平均 27.7% 的有害查询成功越狱)相比,LLM 对英语、法语、俄语和西班牙语的查询表现出更强的人类对齐能力(平均仅有 1.04% 的有害查询成功越狱)。此外,对于英语、丹麦语、捷克语和斯洛文尼亚语的查询,LLM 倾向于产生质量更高的响应(平均 F1F_1 分数为 0.1494),优于其他语言。基于这些发现,我们提出 LDFighter,一种基于相似性的投票方法,以缓解 LLM 中的语言歧视。LDFighter 确保为不同语言的使用者提供一致的服务。我们使用良性查询和有害查询对 LDFighter 进行评估。结果表明,LDFighter 不仅显著降低了越狱成功率,还平均提高了响应质量,证明了其有效性。

关键词

引用

@article{arxiv.2404.18534,
  title  = {Evaluating and Mitigating Linguistic Discrimination in Large Language Models},
  author = {Guoliang Dong and Haoyu Wang and Jun Sun and Xinyu Wang},
  journal= {arXiv preprint arXiv:2404.18534},
  year   = {2024}
}