StructBERT:将语言结构融入预训练以实现深度语言理解
计算与语言
2019-09-30 v3
摘要
近来,预训练语言模型 BERT(及其鲁棒优化版本 RoBERTa)在自然语言理解(NLU)中备受关注,并在情感分类、自然语言推理、语义文本相似度和问答等多种 NLU 任务上取得了最先进的准确率。受 Elman [8] 的线性化探索工作启发,我们通过将语言结构融入预训练,将 BERT 扩展为一个新模型 StructBERT。具体而言,我们使用两个辅助任务对 StructBERT 进行预训练,以充分利用词语和句子的顺序,这两个任务分别在词和句子层面利用语言结构。因此,新模型适应了下游任务所需的不同层次的语言理解。具有结构化预训练的 StructBERT 在多种下游任务上给出了令人惊讶的良好经验结果,包括将 GLUE 基准上的最先进水平推至 89.0(超越所有已发表模型),SQuAD v1.1 问答的 F1 分数至 93.0,SNLI 的准确率至 91.7。
引用
@article{arxiv.1908.04577,
title = {StructBERT: Incorporating Language Structures into Pre-training for Deep Language Understanding},
author = {Wei Wang and Bin Bi and Ming Yan and Chen Wu and Zuyi Bao and Jiangnan Xia and Liwei Peng and Luo Si},
journal= {arXiv preprint arXiv:1908.04577},
year = {2019}
}
备注
10 Pages