中文

利用说服性对话对抗仇恨言论的整合策略

计算与语言 2024-01-17 v1 人工智能

摘要

仇恨言论在社交媒体平台上十分普遍。尽管用于自动检测、标记和屏蔽此类虚假、冒犯性和有害在线内容的工具近来已经成熟,但仅靠此类反应式和暴力式方法只能提供短期和表面的补救,而施害者依然存在。随着能够大规模生成清晰流畅、引人入胜的合成内容的大语言模型公开可用,人们担忧此类恶意内容在网络上的传播会迅速增长。现在需要关注更深层、长期的解决方案,即通过与内容背后的人类施害者进行接触,以改变其观点或至少通过说服手段降低其言论的攻击性。为此,我们提出定义并实验可控策略,用于在在线对话中生成针对仇恨言论的反驳论点。我们实验了利用基于以下方面的特征来控制回应生成:(i) 论证结构与基于推理的 Walton 论证模式,(ii) 反驳言语行为,以及 (iii) 基于人类特征的特质,如大五人格特质和人类价值观。通过自动评估和人工评估,我们确定了能够生成流畅、论证性强且逻辑合理的仇恨对抗论点的最佳特征组合。我们进一步分享了用于自动标注文本这些特征的计算模型,以及现有仇恨言论对话语料库的一个银标准标注版本。

关键词

引用

@article{arxiv.2401.07810,
  title  = {Consolidating Strategies for Countering Hate Speech Using Persuasive Dialogues},
  author = {Sougata Saha and Rohini Srihari},
  journal= {arXiv preprint arXiv:2401.07810},
  year   = {2024}
}