中文

Cordyceps@LT-EDI:以多语言理解修补语言特定的恐同/恐跨分类器

计算与语言 2023-09-26 v1 人工智能

摘要

检测恐跨、恐同及多种其他形式的仇恨言论颇为困难。信号会因语言、文化、地理区域以及特定在线平台等因素而异。本文提出一种联合多语言(M-L)与语言特定(L-S)的恐同与恐跨仇恨言论检测(HSD)方法。M-L模型用于捕捉在特定语言中较少见或缺失、从而被L-S模型忽略的词语、短语与概念。尽管如此,L-S模型更善于理解通常以特定语言书写的用户之文化与语言语境。我们在此构建了一种简单而有效的方法,通过可解释且数据驱动的简单权重插值融合M-L与L-S方法。我们在“社交媒体评论中恐同/恐跨检测共享任务”数据集的任务A上展示了我们的系统,用于恐同与恐跨HSD。我们的系统在五种语言中的三种上取得最佳结果,并在马来alam文本上获得0.997的宏平均F1分数。

关键词

引用

@article{arxiv.2309.13561,
  title  = {Cordyceps@LT-EDI: Patching Language-Specific Homophobia/Transphobia Classifiers with a Multilingual Understanding},
  author = {Dean Ninalga},
  journal= {arXiv preprint arXiv:2309.13561},
  year   = {2023}
}