中文

论掩码语言建模的一个益处:对简单性偏置的鲁棒性

计算与语言 2021-10-12 v1

摘要

尽管预训练掩码语言模型(MLM)取得了成功,MLM 预训练为何有用仍是一个未被完全回答的问题。在本工作中,我们从理论与实证上表明 MLM 预训练使模型对词汇级伪特征具有鲁棒性,部分回答了该问题。我们从理论上证明,当我们可以对条件于上下文的伪特征 Π\Pi 的分布建模时,则(1)Π\Pi 至少与伪特征同样具有信息量,且(2)从 Π\Pi 学习至少与从伪特征学习同样简单。因此,MLM 预训练将模型从伪特征引起的简单性偏置中拯救出来。我们还探索了 MLM 预训练在因果设定中的效力。最后,我们通过在仇恨言论检测与命名实体识别任务上开展实验,弥合了我们的理论与现实世界实践之间的差距。

关键词

引用

@article{arxiv.2110.05301,
  title  = {On a Benefit of Mask Language Modeling: Robustness to Simplicity Bias},
  author = {Ting-Rui Chiang},
  journal= {arXiv preprint arXiv:2110.05301},
  year   = {2021}
}

备注

Work in progress