桥接西班牙语低资源语言中的仇恨言论检测:Meta-Collection与基准数据集
计算与语言
2025-10-14 v1
摘要
仇恨言论对社会凝聚力和个人福祉构成严重威胁,尤其在社交媒体上传播迅速。尽管仇恨言论检测研究已取得进展,但主要聚焦于英语,导致低资源语言可用的资源和基准有限。此外,许多语言拥有多个语言变体,当前方法往往忽视这一因素。与此同时,大型语言模型需要大量数据才能可靠地运行,而低资源语言往往难以满足这一需求。本文通过编译欧洲西班牙语仇恨言论数据集的meta-collection,采用统一的标签和元数据进行标准化。该collection基于对现有资源的系统分析和集成,旨在弥合数据差距,支持更一致和可扩展的仇恨言论检测。我们将该collection扩展为欧洲葡萄牙语,并构建了符合西班牙语且另一种更符合葡萄牙语的西班牙语变体及格利西亚语的标准化版本,创建了对齐的多语言语料库。使用这些资源,我们为西班牙语等伊比利亚语言的仇恨言论检测建立了新的基准。我们评估了最新的大型语言模型在零-shot、few-shot和微调设置下的表现,提供了未来研究的基准结果。此外,我们进行了跨语言分析。我们的发现凸显了在仇恨言论检测中采用多语言和变体感知方法的重要性,为改善欧洲语言中被低估的基准提供了基础。
引用
@article{arxiv.2510.11167,
title = {Bridging Gaps in Hate Speech Detection: Meta-Collections and Benchmarks for Low-Resource Iberian Languages},
author = {Paloma Piot and José Ramom Pichel Campos and Javier Parapar},
journal= {arXiv preprint arXiv:2510.11167},
year = {2025}
}