论掩码语言建模的一个益处:对简单性偏置的鲁棒性
计算与语言
2021-10-12 v1
摘要
尽管预训练掩码语言模型(MLM)取得了成功,MLM 预训练为何有用仍是一个未被完全回答的问题。在本工作中,我们从理论与实证上表明 MLM 预训练使模型对词汇级伪特征具有鲁棒性,部分回答了该问题。我们从理论上证明,当我们可以对条件于上下文的伪特征 的分布建模时,则(1) 至少与伪特征同样具有信息量,且(2)从 学习至少与从伪特征学习同样简单。因此,MLM 预训练将模型从伪特征引起的简单性偏置中拯救出来。我们还探索了 MLM 预训练在因果设定中的效力。最后,我们通过在仇恨言论检测与命名实体识别任务上开展实验,弥合了我们的理论与现实世界实践之间的差距。
引用
@article{arxiv.2110.05301,
title = {On a Benefit of Mask Language Modeling: Robustness to Simplicity Bias},
author = {Ting-Rui Chiang},
journal= {arXiv preprint arXiv:2110.05301},
year = {2021}
}
备注
Work in progress