中文

直接说不:分析攻击性语境下神经对话生成的立场

计算与语言 2021-09-14 v2

摘要

在人类对话上训练的对话模型无意中学会了生成有毒回复。除了产生明确的攻击性话语外,这些模型还可以通过附和攻击性言论来隐含地侮辱某个群体或个人。为了更好地理解语境攻击性语言的动态,我们研究了对话模型在攻击性 Reddit 对话中回复的立场。具体而言,我们创建了 ToxiChat,一个包含 2000 个 Reddit 帖子的众包标注数据集,其模型回复带有攻击性语言和立场标签。我们的分析表明,42% 的人类回复同意有毒评论,而只有 13% 同意安全评论。这种不良行为被神经对话模型所学习,例如 DialoGPT,我们表明它同意攻击性评论的可能性要高出两倍。为了实现对攻击性语言的自动检测,我们在 ToxiChat 上微调了基于 Transformer 的分类器,在攻击性标签上达到了 0.71 的 F1 分数,在立场标签上达到了 0.53 的 Macro-F1 分数。最后,我们量化了可控文本生成(CTG)方法在减轻神经对话模型同意攻击性评论倾向方面的有效性。与基线相比,我们最好的 CTG 模型在同意攻击性评论方面减少了 19%,并减少了 29% 的攻击性回复。我们的工作强调需要进一步努力表征和分析对话模型中的不当行为,以帮助使其更安全。我们的代码和语料库可在 https://github.com/abaheti95/ToxiChat 获取。

关键词

引用

@article{arxiv.2108.11830,
  title  = {Just Say No: Analyzing the Stance of Neural Dialogue Generation in Offensive Contexts},
  author = {Ashutosh Baheti and Maarten Sap and Alan Ritter and Mark Riedl},
  journal= {arXiv preprint arXiv:2108.11830},
  year   = {2021}
}

备注

Accepted at EMNLP 2021