中文

掩码语言建模中的表示缺陷

计算与语言 2024-03-19 v2 机器学习

摘要

掩码语言建模(MLM)因其简单性和有效性,一直是预训练双向文本编码器的最主要方法之一。关于MLM的一个显著问题是,特殊的[MASK]\texttt{[MASK]}符号导致预训练数据与下游数据之间存在差异,因为它只出现在预训练中,而不出现在微调中。在这项工作中,我们对此类差异的后果提供了一个新的视角:我们通过实验和理论证明,MLM预训练会分配一些模型维度专门用于表示[MASK]\texttt{[MASK]}标记,这导致对真实标记的表示缺陷,并限制了预训练模型在适应不含[MASK]\texttt{[MASK]}标记的下游数据时的表达能力。受所发现问题的启发,我们提出了MAE-LM,它使用MLM预训练掩码自编码器架构,但将[MASK]\texttt{[MASK]}标记排除在编码器之外。实验表明,MAE-LM提高了模型维度用于真实标记表示的利用率,并且在GLUE和SQuAD基准上进行微调时,MAE-LM在不同的预训练设置和模型规模下始终优于MLM预训练模型。

关键词

引用

@article{arxiv.2302.02060,
  title  = {Representation Deficiency in Masked Language Modeling},
  author = {Yu Meng and Jitin Krishnan and Sinong Wang and Qifan Wang and Yuning Mao and Han Fang and Marjan Ghazvininejad and Jiawei Han and Luke Zettlemoyer},
  journal= {arXiv preprint arXiv:2302.02060},
  year   = {2024}
}

备注

ICLR 2024