中文

PMI 掩码:相关跨度的原则性掩码方法

机器学习 2020-10-06 v1 计算与语言 机器学习

摘要

均匀随机掩码 token 构成了诸如 BERT 等掩码语言模型(MLMs)预训练中的常见缺陷。我们表明此类均匀掩码允许 MLM 通过依附浅层局部信号来最小化其训练目标,导致预训练低效与次优的下游性能。为解决该缺陷,我们提出 PMI-Masking,一种基于点互信息(PMI)概念的原则性掩码策略,其联合掩码在语料上表现出高搭配的 token n-gram。PMI-Masking 激发、统一并改进了先前试图解决随机均匀 token 掩码缺陷的更具启发式的方法,如全词掩码、实体/短语掩码与随机跨度掩码。具体而言,我们通过实验表明 PMI-Masking 在半数训练时间内达到先前掩码方法的性能,并在训练结束时持续提升性能。

关键词

引用

@article{arxiv.2010.01825,
  title  = {PMI-Masking: Principled masking of correlated spans},
  author = {Yoav Levine and Barak Lenz and Opher Lieber and Omri Abend and Kevin Leyton-Brown and Moshe Tennenholtz and Yoav Shoham},
  journal= {arXiv preprint arXiv:2010.01825},
  year   = {2020}
}