中文

用于大语言模型安全评估的阿拉伯语数据集

计算与语言 2025-02-11 v2

摘要

大语言模型(LLM)的使用日益增长,引发了对其安全性的担忧。虽然许多研究集中在英语上,但考虑到阿拉伯语的语言和文化复杂性,LLM在阿拉伯语中的安全性仍未得到充分探索。在此,我们旨在弥合这一差距。具体而言,我们提出了一个针对阿拉伯地区的安全评估数据集,包含5,799个问题,包括直接攻击、间接攻击以及带有敏感词的无害请求,并经过调整以反映阿拉伯世界的社会文化背景。为了揭示在处理敏感和有争议话题时不同立场的影响,我们提出了一个双视角评估框架。它从政府和反对派的视角评估LLM的回应。对五个领先的以阿拉伯语为中心和多语言LLM的实验揭示了它们安全性能的显著差异。这强化了对特定文化数据集的需求,以确保LLM的负责任部署。

关键词

引用

@article{arxiv.2410.17040,
  title  = {Arabic Dataset for LLM Safeguard Evaluation},
  author = {Yasser Ashraf and Yuxia Wang and Bin Gu and Preslav Nakov and Timothy Baldwin},
  journal= {arXiv preprint arXiv:2410.17040},
  year   = {2025}
}

备注

Accepted at NAACL 2025 Main Conference