IndicSafe:面向南亚地区的多语言 LLM 安全基准
计算与语言
2026-05-18 v2 人工智能
摘要
随着大语言模型(LLM)在多语言环境中部署,其在文化多样化、资源匮乏语言中的安全行为仍知情不明。我们提出首个系统评估 12 种印度语言的 LLM 安全,这些语言拥有超过 12 亿使用者,但在 LLM 训练数据中存在严重欠 représent。我们构建包含 6000 个覆盖种姓、宗教、性别、健康和政治的文化依托提示词的数据集,对 10 个领先 LLM 在翻译变体上的响应进行评估。我们的分析揭示了显著的安全漂移:跨语言一致性仅为 12.8%,且 \texttt{SAFE} 率在语言间差异超过 17%。一些模型在低资源脚本中过度拒绝善意提示,过度标记政治敏感话题,另一些则未能标记不安全生成。我们使用提示词级别的熵、类别偏差得分和多语言一致性指数量化这些故障。我们的发现突显了多语言 LLM 中的关键安全泛化差距,表明安全对齐在语言间无法均匀迁移。我们发布 \textsc{IndicSafe},首个面向印度地区部署的文化感知 LLM 安全评估基准,倡导以区域性 harm 为基础的语言感知对齐策略。
引用
@article{arxiv.2603.17915,
title = {IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia},
author = {Priyaranjan Pattnayak and Sanchari Chowdhuri},
journal= {arXiv preprint arXiv:2603.17915},
year = {2026}
}