中文

权衡己言:通过注意力正则化改进仇恨言论反叙事生成

计算与语言 2023-09-06 v1

摘要

近期用于对抗网络仇恨言论的计算方法是,利用人工策划的数据适配基于预训练 Transformer 的语言模型 (PLMs) 来自动生成反叙事。然而,这一过程可能产生域内过拟合,导致模型仅对与训练数据相似的仇恨生成可接受的叙事,而对其他目标或真实世界有毒语言的迁移能力较弱。本文引入新颖的注意力正则化方法,以提升 PLMs 在反叙事生成上的泛化能力。如此便抑制了对训练特定术语的过拟合,从而产生更多样且更丰富的叙事。我们在一个基准英文数据集上试验了两种基于注意力的正则化技术。在大多数情况下,正则化模型比最先进的方法生成更好的反叙事,无论是在自动指标还是人工评价上,尤其在训练数据中不存在仇恨目标时。本工作为更好且更灵活的反言论生成模型铺平了道路,而该任务的数据集极难制作。

关键词

引用

@article{arxiv.2309.02311,
  title  = {Weigh Your Own Words: Improving Hate Speech Counter Narrative Generation via Attention Regularization},
  author = {Helena Bonaldi and Giuseppe Attanasio and Debora Nozza and Marco Guerini},
  journal= {arXiv preprint arXiv:2309.02311},
  year   = {2023}
}

备注

To appear at CS4OA workshop (INLG-SIGDial)