BURT:基于有意义片段学习的 BERT 启发式通用表示
计算与语言
2021-01-01 v2
摘要
尽管诸如 BERT 等预训练上下文语言模型在各种下游任务上取得显著性能,当前的语言表示仍仅聚焦于特定粒度下的语言目标,当同时涉及多层级语言单元时可能并不适用。因此,本工作引入并探索通用表示学习,即不同层级语言单元在统一向量空间中的嵌入。我们提出一种通用表示模型 BURT(BERT-inspired Universal Representation from learning meaningful segmenT,基于有意义片段学习的 BERT 启发式通用表示),将不同层级语言单元编码至同一向量空间。具体而言,我们基于点互信息(PMI)提取并掩蔽有意义片段,以将不同粒度目标融入预训练阶段。我们在包含 GLUE 和 CLUE 基准的英汉数据集上开展实验,我们的模型在广泛下游任务上超越其基线与替代方法。我们提出构建词、短语和句子类比数据集的方法,并对多种表示模型进行实验,通过任务无关评估检验所学向量空间的几何性质。最后,我们在两个真实文本匹配场景中验证了统一预训练策略的有效性。结果表明,我们的模型显著优于现有信息检索(IR)方法,并产出可直接应用于基于检索的问答与自然语言生成任务的通用表示。
引用
@article{arxiv.2012.14320,
title = {BURT: BERT-inspired Universal Representation from Learning Meaningful Segment},
author = {Yian Li and Hai Zhao},
journal= {arXiv preprint arXiv:2012.14320},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2009.04656