强化有毒言论检测器以抵御隐蔽毒性
计算与语言
2020-10-08 v1
摘要
现代有毒言论检测器在识别伪装攻击性语言方面能力不足,例如刻意规避已知有毒词汇表的对抗性攻击,或隐性偏见的表征。为这类隐蔽毒性构建大规模标注数据集可能非常昂贵。在本工作中,我们提出一个框架,旨在无需大规模隐蔽毒性标注语料库即可强化现有的有毒言论检测器。仅使用少量探测样例就能发掘出数量级更多的伪装攻击言论。我们用这些发现的攻击性样例扩充有毒言论检测器的训练数据,从而使其在保持检测显性毒性效用的同时,对隐蔽毒性更加鲁棒。
引用
@article{arxiv.2010.03154,
title = {Fortifying Toxic Speech Detectors Against Veiled Toxicity},
author = {Xiaochuang Han and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2010.03154},
year = {2020}
}
备注
EMNLP 2020