中文

ERNIE-Doc:一种回溯式长文档建模 Transformer

计算与语言 2021-05-25 v2

摘要

由于内存和时间消耗呈二次增长,Transformer 不适合处理长文档。简单地截断长文档或应用稀疏注意力机制会导致上下文碎片化问题,或在同等模型规模下建模能力较弱。本文提出 ERNIE-Doc,一种基于 Recurrence Transformers 的文档级语言预训练模型。两种精心设计的技术,即回溯馈送机制与增强循环机制,使具有更长有效上下文长度的 ERNIE-Doc 能够捕获完整文档的上下文信息。我们预训练 ERNIE-Doc,通过额外的文档感知片段重排序目标显式学习片段间关系。在英语和中文文档级任务上进行了多种实验。ERNIE-Doc 将 WikiText-103 上困惑度的最优语言建模结果提升至 16.8。此外,在多数语言理解任务(如文本分类和问答)上大幅优于有竞争力的预训练模型。

关键词

引用

@article{arxiv.2012.15688,
  title  = {ERNIE-Doc: A Retrospective Long-Document Modeling Transformer},
  author = {Siyu Ding and Junyuan Shang and Shuohuan Wang and Yu Sun and Hao Tian and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2012.15688},
  year   = {2021}
}

备注

Accepted by ACL 2021 (main conference, long paper)