中文

分布假说并未完全解释掩码语言模型预训练的优势

计算与语言 2023-10-26 v1

摘要

我们从分布假说的视角分析掩码语言建模预训练目标函数。我们研究经掩码语言建模预训练的模型更好的样本效率与更好的泛化能力是否可归因于预训练数据分布属性中编码的语义相似性。通过合成数据集,我们的分析表明分布属性确实导致了预训练掩码语言模型更好的样本效率,但并未完全解释泛化能力。我们还对两个真实世界数据集进行分析,证明分布属性同样无法解释预训练自然语言模型的泛化能力。我们的结果说明了我们对模型预训练的有限理解,并提供了未来研究方向。

关键词

引用

@article{arxiv.2310.16261,
  title  = {The Distributional Hypothesis Does Not Fully Explain the Benefits of Masked Language Model Pretraining},
  author = {Ting-Rui Chiang and Dani Yogatama},
  journal= {arXiv preprint arXiv:2310.16261},
  year   = {2023}
}

备注

EMNLP 2023