统一视觉、文本与版式以实现通用文档处理
计算机视觉与模式识别
2023-03-14 v3 人工智能
计算与语言
机器学习
摘要
我们提出通用文档处理(Universal Document Processing, UDOP),一个统一的文档人工智能基础模型,将文本、图像与版式模态及包括文档理解与生成在内的多样任务格式相统一。UDOP 利用文本内容与所述文档图像间的空间关联,以单一统一表示对图像、文本与版式模态建模。借助新颖的视觉-文本-版式变换器(Vision-Text-Layout Transformer),UDOP 将预训练与多领域下游任务统一为基于提示的序列生成方案。UDOP 同时使用创新自监督目标在大规模无标注文档语料上预训练,并利用多样标注数据。UDOP 还通过掩码图像重建从文本与版式模态生成文档图像。据我们所知,这是文档人工智能领域首次有模型同时实现高质量神经文档编辑与内容定制。我们的方法在 8 项文档人工智能任务(如文档理解与问答,横跨财报、学术论文与网站等多样数据域)上树立最优水平。UDOP 在文档理解基准(Document Understanding Benchmark)排行榜上位居第一。
引用
@article{arxiv.2212.02623,
title = {Unifying Vision, Text, and Layout for Universal Document Processing},
author = {Zineng Tang and Ziyi Yang and Guoxin Wang and Yuwei Fang and Yang Liu and Chenguang Zhu and Michael Zeng and Cha Zhang and Mohit Bansal},
journal= {arXiv preprint arXiv:2212.02623},
year = {2023}
}
备注
CVPR 2023