SomaliBench Eval:衡量开源语言模型英语到索马里拒绝差距
摘要
大型语言模型安全评估仍严重以英语为中心,即使模型在全球部署时也未对低资源语言进行充分测量。我们评估了四个开源指令调优模型在SomaliBench v0上的表现,该基准由本土作者验证的100个有害意图提示在英语和索马里之间成对匹配。对Llama-3.1-8B-Instruct、Gemma-2-9B-Instruct、Qwen-2.5-7B-Instruct和Aya-23-8B进行本地运行,温度为0,并使用相同的英语“有帮助、无害且诚实”(HHH)系统提示。针对每条响应使用固定的Claude Sonnet快照(claude-sonnet-4-5-20250929)进行分类,分为被拒绝、被遵从或不明确;本土作者对分层抽样的80行进行核查。我们发现所有四个模型都存在显著的英语到索马里拒绝差距:Llama-3.1-8B(0.90;95%自助置信区间[0.85, 0.96])、Aya-23-8B(0.75[0.67, 0.83])、Qwen-2.5-7B(0.69[0.59, 0.78])和Gemma-2-9B(0.38[0.27, 0.49])。对于三个模型,主要的索马里非拒绝模式并非流畅的有害合规,而是不明确的输出:空白、错误语言或不连贯的生成。本土验证核查在80行抽样中与裁判员(Cohen's kappa = 1.00)达到100%一致。我们仅报告总体拒绝率、类别差距和可靠性统计数据;原始模型生成 retained locally,不公开。
引用
@article{arxiv.2605.25420,
title = {SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models},
author = {Khalid Yusuf Dahir},
journal= {arXiv preprint arXiv:2605.25420},
year = {2026}
}
备注
12 pages, 3 figures, 4 tables. Code: https://github.com/khaledyusuf44/somalibench_eval Dataset: https://huggingface.co/datasets/khaledyusuf44/somalibench-v0