中文

机器确实看到颜色:大规模语料库中不同形式种族主义话语分类指南

计算与语言 2025-09-30 v3 机器学习

摘要

当前识别和分类文本中种族主义语言的方法依赖于小规模定性方法或仅关注显性种族主义话语的大规模方法。本文提供了一种逐步可推广的指南,用于识别和分类大规模语料库中不同形式的种族主义话语。在我们的方法中,我们首先概念化种族主义及其不同表现形式。然后,我们将这些种族主义表现置于感兴趣的时间和地点背景下,使研究者能够识别其话语形式。最后,我们应用XLM-RoBERTa(XLM-R),一种具有前沿文本上下文理解能力的跨语言监督文本分类模型。我们展示了XLM-R和我们预训练的模型XLM-R-Racismo在大规模语料库中分类种族主义方面优于其他最先进方法。我们使用2018年至2021年间与厄瓜多尔土著社区相关的推文语料库来说明我们的方法。

关键词

引用

@article{arxiv.2401.09333,
  title  = {Machines Do See Color: A Guideline to Classify Different Forms of Racist Discourse in Large Corpora},
  author = {Diana Davila Gordillo and Joan C. Timoneda and Sebastian Vallejo Vera},
  journal= {arXiv preprint arXiv:2401.09333},
  year   = {2025}
}

备注

37 pages, 5 figures, 4 tables