中文

跨语言冒犯性语言检测:数据集、迁移方法与挑战的系统综述

计算与语言 2026-04-02 v3

摘要

社交媒体中冒犯性语言的日益普遍和快速演变加剧了检测的复杂性,尤其凸显了识别多种语言此类内容的挑战。本综述系统且全面地探讨了社交媒体冒犯性语言检测中的跨语言迁移学习(Cross-Lingual Transfer Learning, CLTL)技术。我们的研究是该领域首个专门聚焦于跨语言场景的整体性概述。我们分析了 67 篇相关论文,并从多个维度对这些研究进行分类,包括所用多语言数据集的特征、采用的跨语言资源以及实施的具体 CLTL 策略。根据“迁移什么”,我们还总结了三种主要的 CLTL 迁移方法:实例迁移、特征迁移和参数迁移。此外,我们阐明了该领域当前的挑战和未来的研究机遇。 furthermore,我们已在线提供本综述的资源,包括两个综合表格,为文献中使用的多语言数据集和 CLTL 方法提供了便捷的参考。

关键词

引用

@article{arxiv.2401.09244,
  title  = {Cross-lingual Offensive Language Detection: A Systematic Review of Datasets, Transfer Approaches and Challenges},
  author = {Aiqi Jiang and Arkaitz Zubiaga},
  journal= {arXiv preprint arXiv:2401.09244},
  year   = {2026}
}

备注

35 pages, 7 figures