中文

XYLayoutLM:面向富视觉文档理解的布局感知多模态网络

计算机视觉与模式识别 2022-03-16 v2 计算与语言

摘要

近年来,多种面向富视觉文档理解(VRDU)的多模态网络被提出,表明通过将以视觉和布局信息融入文本嵌入可提升Transformer的性能。然而,现有多数方法利用位置嵌入来引入序列信息,忽视了OCR工具所产生的含噪且不当的阅读顺序。本文提出一种鲁棒的布局感知多模态网络XYLayoutLM,以从我们提出的增强型XY切分(Augmented XY Cut)所生成的正确阅读顺序中捕获并利用丰富的布局信息。此外,提出一种扩张条件位置编码(Dilated Conditional Position Encoding)模块来处理变长输入序列,并在生成位置嵌入的同时从文本与视觉两种模态中额外提取局部布局信息。实验结果表明,我们的XYLayoutLM在文档理解任务上取得了具有竞争力的结果。

关键词

引用

@article{arxiv.2203.06947,
  title  = {XYLayoutLM: Towards Layout-Aware Multimodal Networks For Visually-Rich Document Understanding},
  author = {Zhangxuan Gu and Changhua Meng and Ke Wang and Jun Lan and Weiqiang Wang and Ming Gu and Liqing Zhang},
  journal= {arXiv preprint arXiv:2203.06947},
  year   = {2022}
}

备注

Accepted by CVPR2022