中文

面向阿拉伯语语言模型的文化感知 moderation 过滤器——FanarGuard

计算与语言 2025-11-25 v1

摘要

内容 moderation 过滤器是语言模型对齐失败的关键防护措施。然而,大多数现有过滤器仅关注一般安全,忽视了文化背景。在本工作中,我们提出了FanarGuard,一种双语 moderation 过滤器,用于评估阿拉伯语和英语中的安全性和文化对齐程度。我们构建了一个包含46.8万个提示和响应对的数据集,来自合成数据集和公开数据集,由LLM评判 panel 根据无害性和文化意识对其进行评分,并用于训练两种过滤器变体。为严格评估文化对齐,我们进一步开发了第一个针对阿拉伯语文化背景的基准数据集,包含1000多个敏感提示的LLM生成响应,由人类评审者进行标注。结果表明,FanarGuard在人类注释之间的一致性上优于 inter-annotator reliability,同时在 safety benchmarks 中的性能与SOTA过滤器持平。这一发现凸显了将文化意识整合到 moderation 中的重要性,FanarGuard作为更具情境敏感性的防护措施的实际步骤。

关键词

引用

@article{arxiv.2511.18852,
  title  = {FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models},
  author = {Masoomali Fatehkia and Enes Altinisik and Husrev Taha Sencar},
  journal= {arXiv preprint arXiv:2511.18852},
  year   = {2025}
}