中文

基于领域分类的源特定词项惩罚用于仇恨言论检测中的领域自适应

计算与语言 2022-09-20 v1

摘要

最先进的仇恨言论检测方法在域外设置下通常表现不佳。这通常是由于分类器过度强调源特定信息,从而对其领域不变性产生负面影响。先前的工作尝试使用特征归因方法对来自人工整理列表的与仇恨言论相关的词项进行惩罚,这些方法量化分类器在做出预测时分配给输入词项的重要性。相反,我们提出了一种领域自适应方法,利用领域分类器(学习区分不同领域)和针对仇恨言论类别的特征归因分数,自动抽取并惩罚源特定词项,从而在跨领域评估中带来一致的改进。

关键词

引用

@article{arxiv.2209.08681,
  title  = {Domain Classification-based Source-specific Term Penalization for Domain Adaptation in Hate-speech Detection},
  author = {Tulika Bose and Nikolaos Aletras and Irina Illina and Dominique Fohr},
  journal= {arXiv preprint arXiv:2209.08681},
  year   = {2022}
}

备注

COLING 2022 pre-print