中文

DIA-HARM:面向 50 种英语方言的有害内容检测中的方言差异

计算与语言 2026-04-08 v1

摘要

有害内容检测器——特别是虚假信息分类器——主要是在标准美式英语(SAE)上开发和评估的,导致其对方言变体的鲁棒性尚未得到探索。我们提出DIA-HARM,首个用于评估跨 50 种英语方言(包括美式、英式、非洲、加勒比和亚太等多种方言)的虚假信息检测鲁棒性基准。基于 Multi-VALUE 的语言学变换,我们引入D3(方言虚假信息检测),该语料库源自既定的虚假信息基准,包含 19.5 万样本。我们评估了 16 个检测模型,发现系统性脆弱性:人编写的方言内容会使检测 F1 分数下降 1.4-3.6%,而 AI 生成内容保持稳定。微调的变换器显著优于零样本大语言模型(最佳 F1 为 96.6% vs. 78.3%),部分模型在混合内容上出现超过 33% 的灾难性下降。跨方言迁移分析涵盖 2450 对方言配对,表明多语言模型(mDeBERTa:平均 F1 为 97.2%)能够有效泛化,而单语言模型如 RoBERTa 和 XLM-RoBERTa 在方言输入上失败。这些发现表明,当前的虚假信息检测器可能系统性地不利于数亿非 SAE 说话者。我们发布 DIA-HARM 框架、D3 语料库及评估工具:https://github.com/jsl5710/dia-harm

关键词

引用

@article{arxiv.2604.05318,
  title  = {DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects},
  author = {Jason Lucas and Matt Murtagh and Ali Al-Lawati and Uchendu Uchendu and Adaku Uchendu and Dongwon Lee},
  journal= {arXiv preprint arXiv:2604.05318},
  year   = {2026}
}

备注

Accepted to ACL 2026