中文

开放域聊天机器人的安全性方案

计算与语言 2021-08-06 v3 人工智能

摘要

在大型无标注人类交互语料上训练的模型会学习其中的模式并模仿其中的行为,包括攻击性或其他有害行为以及不想要的偏见。我们研究在开放域生成式对话模型的背景下缓解这些问题的多种方法。我们引入了一种新的人与模型协同回路(human-and-model-in-the-loop)框架,用于训练更安全的模型并对其进行评估,以及一种在生成式模型内部蒸馏安全性考量而部署时无需使用外部分类器的新方法。我们进行实验比较这些方法,发现我们的新技术在(i)自动和人工评估测得的安全性上优于现有模型,同时(ii)相对于最先进水平保持了如吸引度之类的可用性指标。然后我们通过分析模型的失败案例讨论了本工作的局限性。

关键词

引用

@article{arxiv.2010.07079,
  title  = {Recipes for Safety in Open-domain Chatbots},
  author = {Jing Xu and Da Ju and Margaret Li and Y-Lan Boureau and Jason Weston and Emily Dinan},
  journal= {arXiv preprint arXiv:2010.07079},
  year   = {2021}
}