中文

MixCE:通过混合前向与反向交叉熵训练自回归语言模型

计算与语言 2024-05-28 v2 人工智能 机器学习

摘要

自回归语言模型通过最小化模型分布Q相对于数据分布P的交叉熵来训练——即最小化前向交叉熵,这等价于最大似然估计(MLE)。我们观察到以这种方式训练的模型可能“过度泛化”,即生成非人类风格的文本。此外,我们认为反向交叉熵(即P相对于Q的交叉熵)能更好地反映人类评估模型生成文本的方式。因此,我们提出使用MixCE进行学习,这是一种混合前向与反向交叉熵的目标函数。我们在合成数据设定(其中P已知)和真实数据上评估用该目标训练的模型,并表明所得模型无需复杂解码策略即可生成更好的文本。我们的代码和模型公开于 https://github.com/bloomberg/mixce-acl2023

关键词

引用

@article{arxiv.2305.16958,
  title  = {MixCE: Training Autoregressive Language Models by Mixing Forward and Reverse Cross-Entropies},
  author = {Shiyue Zhang and Shijie Wu and Ozan Irsoy and Steven Lu and Mohit Bansal and Mark Dredze and David Rosenberg},
  journal= {arXiv preprint arXiv:2305.16958},
  year   = {2024}
}

备注

ACL 2023 (22 pages)