DisCGen:一种基于话语理论的_counter speech 生成框架
计算与语言
2023-12-01 v1
摘要
Counter speech 可以是打击社交媒体上仇恨内容的有效方法。自动 counter speech 生成可在此过程中提供帮助。然而,生成的 counter speech 只有在扎根于话题、受众和敏感性等语境时才可行,因为这些因素同时影响有效性与恰当性。本工作中,我们提出一种基于话语理论的新型框架,用以研究将 counter speech 与仇恨评论连接起来的推理链接。在该框架内,我们提出:i) 从话语框架衍生的 counter speech 分类法;ii) 用于生成语境扎根 counter speech 的话语知情提示策略。为构建并验证该框架,我们提出一种从 Reddit 收集真实 counter speech 数据集的流程。利用该流程,我们手动标注了 3.9k 对 Reddit 评论对,以识别仇恨言论与 counter speech 的存在。正样本对被标注为我们提出的分类法中的 10 个类别。我们为这些配对标注了改写对应文本,以去除攻击性与第一人称指称。我们展示了通过使用我们的数据集与框架,大语言模型能够生成由话语理论告知的语境扎根 counter speech。根据我们的人工评估,我们的方法可作为防止话语无关模型关键失效的安全保障。
引用
@article{arxiv.2311.18147,
title = {DisCGen: A Framework for Discourse-Informed Counterspeech Generation},
author = {Sabit Hassan and Malihe Alikhani},
journal= {arXiv preprint arXiv:2311.18147},
year = {2023}
}
备注
IJCNLP-AACL, 2023