SpanBERT:通过表示与预测文本片段改进预训练
计算与语言
2020-01-22 v3 机器学习
摘要
我们提出 SpanBERT,一种旨在更好地表示和预测文本片段(span)的预训练方法。我们的方法对 BERT 进行了扩展:(1)掩码连续的随机片段,而非随机 token;(2)训练片段边界表示以预测被掩码片段的完整内容,而不依赖于其中的单个 token 表示。SpanBERT 在各项任务上持续优于 BERT 以及我们调优更好的基线,在问答和共指消解等片段选择任务上取得了显著提升。特别地,在与 BERT-large 相同的训练数据和模型规模下,我们的单一模型在 SQuAD 1.1 和 2.0 上分别取得了 94.6% 和 88.7% 的 F1。我们还在 OntoNotes 共指消解任务上达到了新的 state of the art(79.6% F1),在 TACRED 关系抽取基准上表现强劲,甚至在 GLUE 上也显示出提升。
引用
@article{arxiv.1907.10529,
title = {SpanBERT: Improving Pre-training by Representing and Predicting Spans},
author = {Mandar Joshi and Danqi Chen and Yinhan Liu and Daniel S. Weld and Luke Zettlemoyer and Omer Levy},
journal= {arXiv preprint arXiv:1907.10529},
year = {2020}
}
备注
Accepted at TACL