说话者身份至关重要:分析说话者种族对仇恨分类的影响
计算与语言
2025-10-14 v2 人工智能
摘要
大型语言模型(LLM)为可扩展的内容审核(包括仇恨言论检测)提供了极具吸引力的前景。然而,众所周知,它们也很脆弱,且对边缘化群体和方言存在偏见。这要求对其在仇恨言论检测等高风险任务中的应用进行严格审查。在本研究中,我们调查了使用 LLM 进行仇恨言论分类的鲁棒性,特别是当说话者种族的显式和隐式标记被注入输入时。对于显式标记,我们注入一个提及说话者语言身份的短语。对于隐式标记,我们注入方言特征。通过分析在这些标记存在时模型输出翻转的频率,我们揭示了 3 个 LLM、1 个语言模型(LM)和 5 种语言身份之间不同程度的脆弱性。我们发现,输入中隐式方言标记的存在比显式标记的存在导致更多的模型输出翻转。此外,翻转的百分比因种族而异。最后,我们发现较大的模型更具鲁棒性。我们的发现表明,在部署 LLM 执行仇恨言论检测等高风险任务时需要谨慎。
引用
@article{arxiv.2410.20490,
title = {Who Speaks Matters: Analysing the Influence of the Speaker's Ethnicity on Hate Classification},
author = {Ananya Malik and Kartik Sharma and Shaily Bhatt and Lynnette Hui Xian Ng},
journal= {arXiv preprint arXiv:2410.20490},
year = {2025}
}
备注
9 pages, 3 figures, 3 tables. To appear in EMNLP 2025 findings