MixCE:通过混合前向与反向交叉熵训练自回归语言模型
计算与语言
2024-05-28 v2 人工智能
机器学习
摘要
自回归语言模型通过最小化模型分布Q相对于数据分布P的交叉熵来训练——即最小化前向交叉熵,这等价于最大似然估计(MLE)。我们观察到以这种方式训练的模型可能“过度泛化”,即生成非人类风格的文本。此外,我们认为反向交叉熵(即P相对于Q的交叉熵)能更好地反映人类评估模型生成文本的方式。因此,我们提出使用MixCE进行学习,这是一种混合前向与反向交叉熵的目标函数。我们在合成数据设定(其中P已知)和真实数据上评估用该目标训练的模型,并表明所得模型无需复杂解码策略即可生成更好的文本。我们的代码和模型公开于 https://github.com/bloomberg/mixce-acl2023
引用
@article{arxiv.2305.16958,
title = {MixCE: Training Autoregressive Language Models by Mixing Forward and Reverse Cross-Entropies},
author = {Shiyue Zhang and Shijie Wu and Ozan Irsoy and Steven Lu and Mohit Bansal and Mark Dredze and David Rosenberg},
journal= {arXiv preprint arXiv:2305.16958},
year = {2024}
}
备注
ACL 2023 (22 pages)