掩码语言建模中的表示缺陷
计算与语言
2024-03-19 v2 机器学习
摘要
掩码语言建模(MLM)因其简单性和有效性,一直是预训练双向文本编码器的最主要方法之一。关于MLM的一个显著问题是,特殊的符号导致预训练数据与下游数据之间存在差异,因为它只出现在预训练中,而不出现在微调中。在这项工作中,我们对此类差异的后果提供了一个新的视角:我们通过实验和理论证明,MLM预训练会分配一些模型维度专门用于表示标记,这导致对真实标记的表示缺陷,并限制了预训练模型在适应不含标记的下游数据时的表达能力。受所发现问题的启发,我们提出了MAE-LM,它使用MLM预训练掩码自编码器架构,但将标记排除在编码器之外。实验表明,MAE-LM提高了模型维度用于真实标记表示的利用率,并且在GLUE和SQuAD基准上进行微调时,MAE-LM在不同的预训练设置和模型规模下始终优于MLM预训练模型。
引用
@article{arxiv.2302.02060,
title = {Representation Deficiency in Masked Language Modeling},
author = {Yu Meng and Jitin Krishnan and Sinong Wang and Qifan Wang and Yuning Mao and Han Fang and Marjan Ghazvininejad and Jiawei Han and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2302.02060},
year = {2024}
}
备注
ICLR 2024