中文

CRINGE 损失:学习不应建模的语言

计算与语言 2022-11-14 v1 人工智能

摘要

标准的语言模型训练采用黄金人类文档或人人交互数据,并将所有训练数据视为正例。越来越多的证据表明,即使拥有非常大量的正训练数据,仍然存在一些问题可通过相对少量的负数据——即模型不应做的例子——得到缓解。在这项工作中,我们提出了一种使用此类数据进行训练的新过程,称为 CRINGE 损失(ContRastive Iterative Negative GEneration,对比迭代负例生成)。我们在安全生成、避免矛盾和开放域对话三个不同任务的实验中展示了该方法的有效性。我们的模型优于多个强基线,并且在概念上简单、易于训练和实现。

关键词

引用

@article{arxiv.2211.05826,
  title  = {The CRINGE Loss: Learning what language not to model},
  author = {Leonard Adolphs and Tianyu Gao and Jing Xu and Kurt Shuster and Sainbayar Sukhbaatar and Jason Weston},
  journal= {arXiv preprint arXiv:2211.05826},
  year   = {2022}
}