使用预训练语言模型生成反叙事对抗仇恨言论:一项比较研究
计算与语言
2022-04-05 v1 计算机与社会
摘要
在本工作中,我们针对英语在线仇恨言论的自动反叙事(CN)生成任务,对预训练语言模型的使用进行了广泛研究。我们首先开展比较研究,以确定是否存在特别适合生成CN的特定语言模型(或某类LM)及特定解码机制。结果表明,自回归模型结合随机解码最具前景。随后,我们探究了LM在针对未见仇恨目标生成CN时的表现。我们发现,成功的“跨目标”实验的关键要素并非与训练数据的整体相似性,而是特定训练子集的存在,即一个可与测试目标事先界定共性的目标。最后,我们提出基于增加自动后编辑步骤以精炼生成CN的流水线设想。
引用
@article{arxiv.2204.01440,
title = {Using Pre-Trained Language Models for Producing Counter Narratives Against Hate Speech: a Comparative Study},
author = {Serra Sinem Tekiroglu and Helena Bonaldi and Margherita Fanton and Marco Guerini},
journal= {arXiv preprint arXiv:2204.01440},
year = {2022}
}
备注
To appear in "Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (ACL): Findings"