中文

掩码语言建模与分布假说:词序对预训练影响甚微

计算与语言 2021-09-13 v2 机器学习

摘要

掩码语言模型(MLM)预训练取得令人瞩目表现的一种可能解释是,此类模型已学会表示经典 NLP 流程中普遍存在的句法结构。本文提出一种不同的解释:MLM 在下游任务上的成功几乎完全归因于其建模高阶词共现统计的能力。为证明这一点,我们在词序随机打乱的句子上预训练 MLM,并表明这些模型在下游任务微调后仍能达到高准确率——包括在为忽略词序的模型专门设计的挑战性任务上。根据一些参数化句法探针,我们的模型表现得出奇地好,表明我们在如何检验句法信息表征方面可能存在不足。总体而言,我们的结果表明纯分布信息在很大程度上解释了预训练的成功,并凸显了策划需要更深语言知识的挑战性评测数据集的重要性。

关键词

引用

@article{arxiv.2104.06644,
  title  = {Masked Language Modeling and the Distributional Hypothesis: Order Word Matters Pre-training for Little},
  author = {Koustuv Sinha and Robin Jia and Dieuwke Hupkes and Joelle Pineau and Adina Williams and Douwe Kiela},
  journal= {arXiv preprint arXiv:2104.06644},
  year   = {2021}
}

备注

To appear at EMNLP 2021; 26 pages total (9 main, 6 reference and 11 Appendix)