中文

无头语言模型:基于对比权重绑定的无预测学习

计算与语言 2023-09-18 v1

摘要

语言模型的自监督预训练通常包含对广泛词表上概率分布的预测。在本研究中,我们提出一种创新方法,脱离概率预测,转而通过对比权重绑定(CWT)以对比方式重建输入嵌入。我们将该方法应用于单语与多语语境下无头语言模型的预训练。我们的方法具有实际优势,将训练计算需求至多降低 20 倍,同时提升下游性能与数据效率。在相近计算预算下,相较于经典语言模型,我们观察到 GLUE 分数显著提升 +1.6,LAMBADA 准确率显著改善 +2.7。

关键词

引用

@article{arxiv.2309.08351,
  title  = {Headless Language Models: Learning without Predicting with Contrastive Weight Tying},
  author = {Nathan Godey and Éric de la Clergerie and Benoît Sagot},
  journal= {arXiv preprint arXiv:2309.08351},
  year   = {2023}
}