"Nice Try, Kiddo":探究对话回复中的人身攻击
计算与语言
2021-04-13 v2
摘要
人身攻击(ad hominem)是指针对个人品格的某些特征而非其所持立场的攻击。这类攻击是有害的,因为它们传播隐性偏见并削弱个人的可信度。由于对话系统直接对用户输作出回应,研究对话回复中的人身攻击十分重要。为此,我们提出人身攻击的类别,构建了一个带标注的数据集,并训练了一个分类器来分析人类与对话系统对英文 Twitter 帖子的回复。我们特别比较了关于边缘化群体(#BlackLivesMatter、#MeToo)与其他话题(#Vegan、#WFH)的回复,因为人身攻击的辱骂性语言可能进一步放大权力向边缘化群体之外的倾斜。此外,我们提出了一种约束解码技术,该技术使用显著 -gram 相似度作为对 top- 采样的软约束,以减少生成的人身攻击数量。我们的结果表明:1)人类与 DialoGPT 的回复在围绕边缘化群体的讨论中均含有更多人身攻击;2)训练数据中不同数量的人身攻击会影响生成人身攻击的可能性;3)我们可以使用约束解码技术减少生成对话回复中的人身攻击。
引用
@article{arxiv.2010.12820,
title = {"Nice Try, Kiddo": Investigating Ad Hominems in Dialogue Responses},
author = {Emily Sheng and Kai-Wei Chang and Premkumar Natarajan and Nanyun Peng},
journal= {arXiv preprint arXiv:2010.12820},
year = {2021}
}
备注
NAACL 2021