预见端到端对话式 AI 的安全问题:框架与工具
计算与语言
2021-07-26 v3 人工智能
摘要
在过去几年中,端到端神经对话智能体在与人类进行闲聊对话的能力上有了巨大提升。然而,这些模型通常在来自互联网的大规模数据集上训练,因此可能从数据中习得不良行为,例如有毒或其他有害语言。研究人员因而必须应对如何以及何时发布这些模型的问题。在本文中,我们调研了端到端对话式 AI 安全性的问题图景,并讨论近期与相关工作。我们强调了价值、潜在积极影响与潜在危害之间的张力,并遵循价值敏感设计的原则,提供了一个用于决定是否以及如何发布这些模型的框架。此外,我们提供了一套工具,使研究人员能够在训练和发布端到端对话式 AI 模型时做出更明智的决策。
引用
@article{arxiv.2107.03451,
title = {Anticipating Safety Issues in E2E Conversational AI: Framework and Tooling},
author = {Emily Dinan and Gavin Abercrombie and A. Stevie Bergman and Shannon Spruit and Dirk Hovy and Y-Lan Boureau and Verena Rieser},
journal= {arXiv preprint arXiv:2107.03451},
year = {2021}
}