中文

使用预训练语言模型生成反叙事对抗仇恨言论:一项比较研究

计算与语言 2022-04-05 v1 计算机与社会

摘要

在本工作中,我们针对英语在线仇恨言论的自动反叙事(CN)生成任务,对预训练语言模型的使用进行了广泛研究。我们首先开展比较研究,以确定是否存在特别适合生成CN的特定语言模型(或某类LM)及特定解码机制。结果表明,自回归模型结合随机解码最具前景。随后,我们探究了LM在针对未见仇恨目标生成CN时的表现。我们发现,成功的“跨目标”实验的关键要素并非与训练数据的整体相似性,而是特定训练子集的存在,即一个可与测试目标事先界定共性的目标。最后,我们提出基于增加自动后编辑步骤以精炼生成CN的流水线设想。

关键词

引用

@article{arxiv.2204.01440,
  title  = {Using Pre-Trained Language Models for Producing Counter Narratives Against Hate Speech: a Comparative Study},
  author = {Serra Sinem Tekiroglu and Helena Bonaldi and Margherita Fanton and Marco Guerini},
  journal= {arXiv preprint arXiv:2204.01440},
  year   = {2022}
}

备注

To appear in "Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (ACL): Findings"