中文

Lost in Localization:构建带人类-in-the-loop验证的拉巴克基准(RabakBench)以衡量多语言安全差距

计算与语言 2026-02-03 v2 机器学习

摘要

大语言模型(LLM)常在低资源语言变体(如代码混合口语和地区方言)中难以维持安全性能。我们引入RabakBench,一个覆盖新加坡独特语言景观(包括 Singlish、中文、马来语与泰米尔语)的多语言安全基准及可扩展管线。我们通过三个阶段构建基准:(1)生成:通过LLM驱动的红队测试扩展真实不安全网页内容;(2)标注:应用半自动化多标签标注,使用多数投票LLM标注员;(3)翻译:执行高保真、能保持毒性的翻译。最终数据集包含超过5000个案例,涵盖六个细粒度安全类别。尽管采用LLM实现规模化,本框架仍维持严格的人类监督,实现0.70-0.80的注释者间一致性。评估13种最先进的安全护栏,揭示其在低资源语言中的显著性能下降,凸显本地化评估的必要性。RabakBench为在资源不足社区构建安全基准提供可复现框架。

关键词

引用

@article{arxiv.2507.05980,
  title  = {Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps},
  author = {Gabriel Chua and Leanne Tan and Ziyu Ge and Roy Ka-Wei Lee},
  journal= {arXiv preprint arXiv:2507.05980},
  year   = {2026}
}