掩码语言建模的归纳偏置:从统计依赖到句法依赖
计算与语言
2021-04-13 v1 人工智能
机器学习
摘要
我们研究以无监督方式掩码并预测词元如何产生语言结构及下游性能提升。近期理论表明,预训练语言模型通过隐式充当下游任务完形填空简化的掩码获得了有用的归纳偏置。尽管这一解释颇具吸引力,我们表明实践中使用的随机掩码策略的成功不能仅由此类类完形填空掩码来解释。我们使用三个不同分类数据集的任务特定词典构建类完形填空掩码,并表明预训练性能提升的大部分来自与词典无关的通用掩码。为解释这些通用掩码的经验成功,我们展示了掩码语言模型(MLM)目标与图模型中学习统计依赖的现有方法之间的对应关系。利用这一点,我们推导出一种提取 MLM 中学习到的统计依赖的方法,并表明这些依赖以句法结构的形式编码了有用的归纳偏置。在无监督句法分析评估中,仅在隐含统计依赖结构上构造最小生成树就优于一种经典的无监督句法分析方法(58.74 对比 55.91 UUAS)。
引用
@article{arxiv.2104.05694,
title = {On the Inductive Bias of Masked Language Modeling: From Statistical to Syntactic Dependencies},
author = {Tianyi Zhang and Tatsunori Hashimoto},
journal= {arXiv preprint arXiv:2104.05694},
year = {2021}
}
备注
NAACL-HLT 2021