ERNIE-Doc:一种回溯式长文档建模 Transformer
计算与语言
2021-05-25 v2
摘要
由于内存和时间消耗呈二次增长,Transformer 不适合处理长文档。简单地截断长文档或应用稀疏注意力机制会导致上下文碎片化问题,或在同等模型规模下建模能力较弱。本文提出 ERNIE-Doc,一种基于 Recurrence Transformers 的文档级语言预训练模型。两种精心设计的技术,即回溯馈送机制与增强循环机制,使具有更长有效上下文长度的 ERNIE-Doc 能够捕获完整文档的上下文信息。我们预训练 ERNIE-Doc,通过额外的文档感知片段重排序目标显式学习片段间关系。在英语和中文文档级任务上进行了多种实验。ERNIE-Doc 将 WikiText-103 上困惑度的最优语言建模结果提升至 16.8。此外,在多数语言理解任务(如文本分类和问答)上大幅优于有竞争力的预训练模型。
引用
@article{arxiv.2012.15688,
title = {ERNIE-Doc: A Retrospective Long-Document Modeling Transformer},
author = {Siyu Ding and Junyuan Shang and Shuohuan Wang and Yu Sun and Hao Tian and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2012.15688},
year = {2021}
}
备注
Accepted by ACL 2021 (main conference, long paper)