无头语言模型:基于对比权重绑定的无预测学习
计算与语言
2023-09-18 v1
摘要
语言模型的自监督预训练通常包含对广泛词表上概率分布的预测。在本研究中,我们提出一种创新方法,脱离概率预测,转而通过对比权重绑定(CWT)以对比方式重建输入嵌入。我们将该方法应用于单语与多语语境下无头语言模型的预训练。我们的方法具有实际优势,将训练计算需求至多降低 20 倍,同时提升下游性能与数据效率。在相近计算预算下,相较于经典语言模型,我们观察到 GLUE 分数显著提升 +1.6,LAMBADA 准确率显著改善 +2.7。
引用
@article{arxiv.2309.08351,
title = {Headless Language Models: Learning without Predicting with Contrastive Weight Tying},
author = {Nathan Godey and Éric de la Clergerie and Benoît Sagot},
journal= {arXiv preprint arXiv:2309.08351},
year = {2023}
}