XDoc:面向跨格式文档理解的统一预训练模型
计算与语言
2022-10-07 v1
摘要
预训练的兴起近期见证了文档理解的快速发展。预训练与微调框架已有效用于处理各种格式的文本,包括纯文本、文档文本与网页文本。尽管取得了有前景的性能,现有预训练模型通常一次仅针对一种特定文档格式,难以融合来自多种文档格式的知识。为此,我们提出 XDoc,一种在单一模型中处理不同文档格式的统一预训练模型。为参数高效,我们对不同格式共享骨干参数,如词嵌入层与 Transformer 层。同时,我们引入具有轻量参数的自适应层以增强不同格式间的区分度。实验结果表明,仅使用 36.7% 的参数,XDoc 在多种下游任务上取得了与独立预训练模型相当甚至更优的性能,这对于实际部署而言具有成本效益。代码与预训练模型将在 \url{https://aka.ms/xdoc} 公开提供。
引用
@article{arxiv.2210.02849,
title = {XDoc: Unified Pre-training for Cross-Format Document Understanding},
author = {Jingye Chen and Tengchao Lv and Lei Cui and Cha Zhang and Furu Wei},
journal= {arXiv preprint arXiv:2210.02849},
year = {2022}
}
备注
EMNLP 2022