中文

EMO:用于自回归语言建模的推土机距离优化

计算与语言 2024-02-07 v7

摘要

神经语言模型是人类文本的概率模型。它们主要通过最大似然估计(MLE)进行训练,这等价于最小化经验数据分布与模型分布之间的前向交叉熵。然而,从此类模型学到的分布中解码时,仍广泛观察到各种退化现象。我们确定前向交叉熵作为对齐人类与模型分布的距离度量是次优的,原因在于其(1)召回优先性、(2)对负多样性的忽视以及(3)训练-测试不匹配。在本文中,我们提出用于自回归语言建模的推土机距离优化(EMO)。EMO利用推土机距离的内在性质来应对上述挑战。由于直接计算的高复杂性,我们进一步引入EMO的一个可行上界以简化端到端训练。在对使用EMO和MLE训练的语言模型进行广泛评估后,我们发现EMO在跨领域的语言建模性能上始终优于MLE。此外,EMO在仅用25,000个句子进行最少微调的情况下,展现出下游性能的显著提升。这凸显了EMO作为增强大规模预训练语言模型的轻量级校准方法的巨大潜力。

关键词

引用

@article{arxiv.2310.04691,
  title  = {EMO: Earth Mover Distance Optimization for Auto-Regressive Language Modeling},
  author = {Siyu Ren and Zhiyong Wu and Kenny Q. Zhu},
  journal= {arXiv preprint arXiv:2310.04691},
  year   = {2024}
}

备注

To appear at ICLR 2024