通过降低表示混淆改进预训练
计算与语言
2023-02-10 v2
摘要
在本工作中,我们重新审视基于Transformer的预训练语言模型,并分别识别出位置编码与模型表示中两类不同的信息混淆。首先,我们表明在相对位置编码中,对相对距离与方向的联合建模带来了两类异质信息之间的混淆。这可能使模型无法捕捉相同距离与相反方向的关联语义,进而影响下游任务性能。其次,我们注意到采用掩码语言建模(MLM)预训练目标的BERT输出相似的词元表示(不同词元的最后隐藏状态)与头表示(不同头的注意力权重),这可能限制不同词元与头所表达信息的多样性。受上述考察启发,我们提出两种改进预训练语言模型的新技术:解耦方向相对位置(DDRP)编码与MTH预训练目标。DDRP解耦经典相对位置编码中的相对距离特征与方向特征。MTH在MLM之外施加两个新颖辅助正则化项,以增大(a)不同词元最后隐藏状态之间与(b)不同头注意力权重之间的差异性。这些设计使模型能更清晰地捕捉不同类别的信息,从而缓解表示学习中的信息混淆以利于优化。在GLUE基准上的大量实验与消融研究证明了我们所提方法的有效性。
引用
@article{arxiv.2210.04246,
title = {Better Pre-Training by Reducing Representation Confusion},
author = {Haojie Zhang and Mingfei Liang and Ruobing Xie and Zhenlong Sun and Bo Zhang and Leyu Lin},
journal= {arXiv preprint arXiv:2210.04246},
year = {2023}
}
备注
EACL 2023(Findings)