中文

关于中间预训练中掩码策略的影响

计算与语言 2021-10-04 v2 机器学习

摘要

当前NLP模型主要通过“预训练然后微调”的两阶段流程进行训练。已有工作表明,插入一个使用启发式掩码策略进行掩码语言建模(MLM)的中间预训练阶段,可显著提升最终性能。然而,仍不清楚:(1)此类中间预训练在何种情况下有帮助;(2)针对给定任务,手工设计的启发式目标是否最优;(3)为某一任务设计的掩码策略是否能泛化到该任务之外。本文开展大规模实证研究,探究九项跨三类任务在中间预训练中各掩码策略的影响。关键的是,我们引入通过直接监督或元学习自动发现最优掩码策略的方法。我们得出结论:中间预训练的成功依赖于合适的预训练语料、输出格式(即掩码片段或完整句子)的选择,以及对MLM在下游任务中所起作用清晰的理解。此外,我们发现所学掩码策略在TriviaQA上优于掩码命名实体的启发式方法,且从一任务学到的策略在某些情况下可正向迁移至其他任务,值得未来沿此方向研究。

关键词

引用

@article{arxiv.2104.08840,
  title  = {On the Influence of Masking Policies in Intermediate Pre-training},
  author = {Qinyuan Ye and Belinda Z. Li and Sinong Wang and Benjamin Bolte and Hao Ma and Wen-tau Yih and Xiang Ren and Madian Khabsa},
  journal= {arXiv preprint arXiv:2104.08840},
  year   = {2021}
}

备注

Accepted to EMNLP 2021. Camera-ready version