中文

超越仇恨言论:NLP 在揭示非人化语言方面的挑战与机遇

计算与语言 2025-07-11 v2

摘要

非人化,即否认个人或群体的人类特质,是一种特别有害的仇恨言论形式,可能使针对边缘化社区的暴力正常化。尽管在检测一般仇恨言论的 NLP 方面取得了进展,但由于标注数据稀缺以及此类表达的微妙性质,识别非人化语言的方法仍然有限。在本工作中,我们系统评估了四种最先进的大型语言模型(LLMs)——Claude、GPT、Mistral 和 Qwen——用于非人化检测。我们的结果表明,只有在优化配置下,仅有一个模型(Claude)实现了强劲的性能(F1 超过 80%),而其他模型尽管具备能力,表现仅属中等。当区分非人化与相关的仇恨类型(如贬低)时,性能进一步下降。我们还确定了目标群体之间的系统性差异:模型倾向于过度预测某些身份(例如男同性恋者)的非人化,而对其他身份(例如难民)则识别不足。这些发现表明,在将预训练语言模型应用于非人化检测任务时,需要进行系统的群体级评估。

关键词

引用

@article{arxiv.2402.13818,
  title  = {Beyond Hate Speech: NLP's Challenges and Opportunities in Uncovering Dehumanizing Language},
  author = {Hamidreza Saffari and Mohammadamin Shafiei and Hezhao Zhang and Lasana Harris and Nafise Sadat Moosavi},
  journal= {arXiv preprint arXiv:2402.13818},
  year   = {2025}
}

备注

15 pages, 12 figures, 12 tables