中文

低资源西非语言的语言安全鲁棒性基准

计算与语言 2026-03-23 v1 人工智能

摘要

大语言模型的安全对齐主要依赖英语训练数据。当有害意图以低资源语言表达时,仅在英语中有效的拒绝机制常常失效。我们引入LSR(Linguistic Safety Robustness),首个系统性衡量西非语言(约鲁巴语、豪萨语、伊博语与伊加拉语)中跨语言拒绝性能衰减的基准。LSR采用双探针评估协议——向同一模型提交匹配的英语与目标语言探针——并引入拒绝质心漂移(Refusal Centroid Drift, RCD)指标,量化模型英语拒绝行为在目标语言中保留多少。我们评估了Gemini 2.5 Flash在四类有害情境下的14个文化化攻击探针。英语拒绝率约为90%。在西非语言中,拒绝率下降至35%-55%,伊加拉语显示最严重退化(RCD=0.55)。LSR在Inspect AI评估框架中实现,已作为UK AISI的inspect_evals仓库的即插即用贡献发布。现场参考实现与基准数据集已公开。

关键词

引用

@article{arxiv.2603.19273,
  title  = {LSR: Linguistic Safety Robustness Benchmark for Low-Resource West African Languages},
  author = {Godwin Abuh Faruna},
  journal= {arXiv preprint arXiv:2603.19273},
  year   = {2026}
}

备注

6 pages. Reference implementation: https://huggingface.co/spaces/Faruna01/lsr-dashboard. Dataset: https://huggingface.co/datasets/Faruna01/lsr-benchmark