中文

所有语言都重要:论大语言模型的多语言安全性

计算与语言 2024-06-21 v2 人工智能

摘要

安全性处于大语言模型(LLMs)开发与部署的核心。然而,以往的安全基准仅关注单一语言中的安全性,例如预训练数据中的多数语言如英语。在这项工作中,我们构建了首个面向 LLMs 的多语言安全基准 XSafety,以回应 LLMs 在实践中的全球部署。XSafety 涵盖 10 种跨越多个语系的语言中 14 类常用安全问题。我们利用 XSafety 对 4 个广泛使用的 LLMs(包括闭源 API 与开源模型)的多语言安全性进行实证研究。实验结果表明,所有 LLM 对非英语查询产生的不安全响应显著多于英语查询,表明有必要为非英语语言开发安全对齐。此外,我们提出几种简单有效的提示方法,通过唤起安全知识并改善安全对齐的跨语言泛化来提升 ChatGPT 的多语言安全性。我们的提示方法可将非英语查询的不安全响应比例从 19.1% 显著降低至 9.7%。我们在 https://github.com/Jarviswang94/Multilingual_safety_benchmark 发布了数据。

关键词

引用

@article{arxiv.2310.00905,
  title  = {All Languages Matter: On the Multilingual Safety of Large Language Models},
  author = {Wenxuan Wang and Zhaopeng Tu and Chang Chen and Youliang Yuan and Jen-tse Huang and Wenxiang Jiao and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2310.00905},
  year   = {2024}
}

备注

Accepted by ACL 2024 Findings. The first multilingual safety benchmark for large language models