AnnoBERT:有效表示多位标注者的标签选择以改进仇恨言论检测
计算与语言
2023-01-11 v2 社会与信息网络
摘要
监督学习方法通常依赖于基于多数投票的标签。然而,在仇恨言论检测等主观任务中,很难在标注者之间达成高度一致。现有的神经网络模型主要将标签视为分类变量,而忽略了多样标签文本中的语义信息。在本文中,我们提出了 AnnoBERT,这是一种首创的架构,它将标注者特征和标签文本与基于 Transformer 的模型集成以检测仇恨言论,通过协同主题回归(CTR)基于每位标注者的特征生成独特表示,并整合标签文本以丰富文本表示。在训练期间,模型将标注者与其对给定文本的标签选择相关联;在评估期间,当标签信息不可用时,模型利用学习到的关联来预测参与标注者给出的聚合标签。所提出的方法在检测仇恨言论方面显示出优势,特别是在少数类和标注者存在分歧的边缘情况下。当数据集的标签不平衡程度更大时,整体性能的提升最为显著,这表明了其在识别现实世界仇恨言论中的实用价值,因为与正常(非仇恨)言论相比,社交媒体上处于野生环境中的仇恨言论体量极小。通过消融研究,我们展示了标注者嵌入和标签文本对模型性能的相对贡献,并测试了一系列替代的标注者嵌入和标签文本组合。
关键词
引用
@article{arxiv.2212.10405,
title = {AnnoBERT: Effectively Representing Multiple Annotators' Label Choices to Improve Hate Speech Detection},
author = {Wenjie Yin and Vibhor Agarwal and Aiqi Jiang and Arkaitz Zubiaga and Nishanth Sastry},
journal= {arXiv preprint arXiv:2212.10405},
year = {2023}
}
备注
accepted at ICWSM 2023