中文

新加坡低资源语言的毒性红队测试:构建LLM安全基准

计算与语言 2025-09-24 v2

摘要

大语言模型 (LLM) 的发展已深刻改变自然语言处理领域,但其在低资源、多语言环境中的安全机制仍鲜有探索。本文旨在弥合这一差距。特别是,我们引入了 \textsf{SGToxicGuard},一个用于评估新加坡多样化语言环境下LLM安全的数据集和评估框架,包括 Singlish、中文、马来语和泰米语。SGToxicGuard采用红队方法系统性地探测LLM在三个真实场景中的漏洞:\textit{conversation}(对话)、\textit{question-answering}(问答)和\textit{content composition}(内容创作)。我们对多种state-of-the-art 多语言LLM进行了广泛实验,结果揭示了其安全防护存在的关键缺口。通过提供关于文化敏感性和毒性缓解的可操作见解,我们为在语言多样化环境中构建更安全、更包容的AI系统奠定了基础。\footnote{数据集链接: https://github.com/Social-AI-Studio/SGToxicGuard.} \textcolor{red}{声明:本文包含可能令部分读者感到不适的敏感内容。}

关键词

引用

@article{arxiv.2509.15260,
  title  = {Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore's Low-Resource Languages},
  author = {Yujia Hu and Ming Shan Hee and Preslav Nakov and Roy Ka-Wei Lee},
  journal= {arXiv preprint arXiv:2509.15260},
  year   = {2025}
}

备注

9 pages, EMNLP 2025