中文

SaFeRDialogues:在对话安全失败后优雅地接受反馈

计算与语言 2022-05-06 v2 人工智能

摘要

当前的开放域对话模型很容易产生不当言论。从对话伙伴给出的对话反馈中进行在线学习,是模型改进和适应的一条有前景的途径,从而减少此类安全失败的发生。然而,当前的最先进模型往往以防御性或无视性的回复来应对反馈。这会造成不愉快的体验,并可能阻碍对话伙伴在未来提供反馈。本工作提出了 SaFeRDialogues,一个关于对安全失败相关对话反馈进行优雅回复的任务和数据集。我们收集了一个包含 1 万条对话的数据集,展示了安全失败、指示失败的反馈以及确认该反馈的回复。我们展示了在该数据集上进行微调如何使对话被人类评估者认为更有可能导向文明的对话,同时不牺牲吸引力或一般对话能力。

关键词

引用

@article{arxiv.2110.07518,
  title  = {SaFeRDialogues: Taking Feedback Gracefully after Conversational Safety Failures},
  author = {Megan Ung and Jing Xu and Y-Lan Boureau},
  journal= {arXiv preprint arXiv:2110.07518},
  year   = {2022}
}

备注

Accepted at ACL 2022