中文

知位知物:面向文档理解的统一词块预训练

计算与语言 2022-08-01 v2 人工智能

摘要

由于文档布局复杂,从中提取信息颇具挑战。多数既往研究以自监督方式开发多模态预训练模型。本文关注包含文本与布局信息的词块嵌入学习,提出UTel,一种具有统一文本与布局预训练(Unified TExt and Layout pre-training)的语言模型。具体而言,我们提出两个预训练任务:用于布局学习的周边词预测(SWP),以及用于区分不同词块的词嵌入对比学习(CWE)。此外,我们将常用的1D位置嵌入替换为1D截断相对位置嵌入。如此,掩码布局-语言建模(MLLM)与两个新提任务的联合训练以统一方式实现了语义与空间特征的交互。另外,所提UTel通过移除1D位置嵌入可处理任意长度序列,同时保持有竞争力的性能。大量实验结果表明,UTel学到了更优的联合表示,并在各类下游任务上取得优于既往方法的性能,且无需图像模态。代码见\url{https://github.com/taosong2019/UTel}。

关键词

引用

@article{arxiv.2207.13979,
  title  = {Knowing Where and What: Unified Word Block Pretraining for Document Understanding},
  author = {Song Tao and Zijian Wang and Tiantian Fan and Canjie Luo and Can Huang},
  journal= {arXiv preprint arXiv:2207.13979},
  year   = {2022}
}

备注

incomplete experiments