中文

CounterGeDi:一种生成礼貌、解毒且具情感的反驳言论的可控方法

计算与语言 2022-05-10 v1 计算机与社会

摘要

近来,许多研究试图构建生成模型,通过为对抗网络仇恨的爆炸式蔓延提供反驳言论建议来辅助反仇恨发言者。然而,由于这些建议来自普通生成模型,它们可能不具备对抗特定仇恨言论实例所需的恰当属性。本文提出CounterGeDi——一种生成判别器(GeDi)集成,用于引导DialoGPT模型生成更礼貌、解毒且带有情感的反驳言论。我们使用三个数据集生成反驳言论,并观察到不同属性分数上的显著提升。礼貌分数和解毒分数分别提高了约15%和6%,而反驳言论中的情感在所有数据集上均提升了至少10%。我们还进行了三属性控制的实验,并观察到在组合互补属性(例如礼貌、愉悦和解毒)时,相较单属性结果有显著提升。在所有这些实验中,所生成文本的相关性并未因这些控制的应用而下降。

关键词

引用

@article{arxiv.2205.04304,
  title  = {CounterGeDi: A controllable approach to generate polite, detoxified and emotional counterspeech},
  author = {Punyajoy Saha and Kanishk Singh and Adarsh Kumar and Binny Mathew and Animesh Mukherjee},
  journal= {arXiv preprint arXiv:2205.04304},
  year   = {2022}
}

备注

Accepted at IJCAI-ECAI 2022, 10 pages, 2 figures, 11 tables, Code is available at https://github.com/hate-alert/CounterGEDI