中文

学习不该学什么:面向聊天机器人的生成式安全

计算与语言 2023-04-26 v2

摘要

生成式开放域对话模型尤其容易生成不安全内容,因为它们基于网络社交数据训练。先前缓解此问题的方法存在缺陷,例如打断对话流、对未见有毒输入语境泛化能力有限,以及为安全牺牲对话质量。在本文中,我们提出一种名为“LOT”(Learn NOT to,学习不)的新框架,它采用对比损失,通过从正、负训练信号中学习来增强泛化能力。我们的方法不同于标准对比学习框架,在于它从先前已学习的安全与不安全语言分布中自动获取正、负信号。LOT 框架利用散度将生成从不安全子空间引向安全子空间,同时保持对话流。我们的方法在解码时兼具内存与时间效率,并在保持吸引力与流畅性的同时有效降低毒性。实证结果表明,与基线模型相比,LOT 将毒性降低至多四倍,同时实现高出四至六倍的吸引力与流畅性。我们的发现进一步得到人工评估的佐证。

关键词

引用

@article{arxiv.2304.11220,
  title  = {Learn What NOT to Learn: Towards Generative Safety in Chatbots},
  author = {Leila Khalatbari and Yejin Bang and Dan Su and Willy Chung and Saeed Ghadimi and Hossein Sameti and Pascale Fung},
  journal= {arXiv preprint arXiv:2304.11220},
  year   = {2023}
}

备注

9 pages, 3 tables, 3 figures