中文

LinguaSafe:面向大型语言模型的全方位多语言安全基准

计算与语言 2025-08-28 v2 人工智能

摘要

大型语言模型(LLM)在全球技术领域的广泛采用和日益凸显的地位, necessitates 将注意力严格聚焦于确保其在多样化语言和文化语境下的安全性。现有多语言安全评估缺乏全面评估和多样化数据,限制了其有效性,阻碍了构建鲁健的多语言安全对齐系统。为填补这一关键空白,我们引入 LinguaSafe,一个注重语言真实性的全面多语言安全基准。LinguaSafe 数据集包含 45000 条英文语料,覆盖 12 种语言,从匈牙利到马来语。通过翻译、再创作和本土化数据相结合精心策划的该数据集,满足了对 LLM 进行多语言安全评估的关键需求,填补了在匈牙利到马来语等众多 underrepresented 语言领域进行 LLM 安全评估的空白。LinguaSafe 提供了一个多维度细粒度的评估框架,包括直接和间接安全评估,并进一步评估了过度敏感性。不同领域和不同语言下的安全和有用性评估结果差异显著,即便在资源水平相似的语言之间也如此。我们的基准提供了一整套全面的指标,用于深入的安全评估,强调了在 LLM 中进行全面多语言安全评估的重要性,以实现更均衡的安全对齐。我们的数据集和代码已公开发布,以促进该领域多语言 LLM 安全研究的进一步发展。

关键词

引用

@article{arxiv.2508.12733,
  title  = {LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models},
  author = {Zhiyuan Ning and Tianle Gu and Jiaxin Song and Shixin Hong and Lingyu Li and Huacan Liu and Jie Li and Yixu Wang and Meng Lingyu and Yan Teng and Yingchun Wang},
  journal= {arXiv preprint arXiv:2508.12733},
  year   = {2025}
}

备注

7pages, 5 figures