BERT:用于语言理解的深度双向 Transformer 预训练
计算与语言
2019-05-28 v2
摘要
我们提出一种新的语言表示模型 BERT,其意为来自 Transformer 的双向编码器表示(Bidirectional Encoder Representations from Transformers)。与近期的语言表示模型不同,BERT 被设计用于通过联合调节所有层中的左右上下文,从未标注文本预训练深度双向表示。因此,预训练的 BERT 模型仅需一个额外的输出层进行微调,即可为广泛任务(如问答与语言推断)创建最先进的模型,而无需大量的任务特定架构修改。BERT 概念上简单且经验上强大。它在十一项自然语言处理任务上取得新的 SOTA 结果,包括将 GLUE 分数推至 80.5%(绝对提升 7.7 个百分点)、MultiNLI 准确率至 86.7%(绝对提升 4.6%)、SQuAD v1.1 问答测试 F1 至 93.2(绝对提升 1.5 个百分点)以及 SQuAD v2.0 测试 F1 至 83.1(绝对提升 5.1 个百分点)。
引用
@article{arxiv.1810.04805,
title = {BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding},
author = {Jacob Devlin and Ming-Wei Chang and Kenton Lee and Kristina Toutanova},
journal= {arXiv preprint arXiv:1810.04805},
year = {2019}
}