中文

ROAP:一种用于优化布局Transformer在关键信息提取中的阅读顺序与注意力先验流水线

计算机视觉与模式识别 2026-01-12 v1 计算与语言

摘要

多模态Transformer在视觉丰富文档理解中的有效性受到两个固有局限性的严重制约:缺乏对逻辑阅读顺序的显式建模,以及视觉Token的干扰稀释了对文本语义的注意力。为了应对这些挑战,本文提出了ROAP,这是一种轻量级且与架构无关的流水线,旨在不改变其预训练骨干网络的情况下优化布局Transformer中的注意力分布。所提出的流水线首先采用自适应XY间隙树来从复杂布局中稳健地提取分层阅读序列。然后,这些序列通过一种阅读顺序感知的相对位置偏置被整合到注意力机制中。此外,引入了一种文本Token子块注意力先验,以自适应地抑制视觉噪声并增强细粒度的文本间交互。在FUNSD和CORD基准数据集上的大量实验表明,ROAP持续提升了代表性骨干网络(包括LayoutLMv3和GeoLayoutLM)的性能。这些发现证实,显式建模阅读逻辑和调节模态干扰对于稳健的文档理解至关重要,为复杂布局分析提供了一种可扩展的解决方案。实现代码将在https://github.com/KevinYuLei/ROAP发布。

关键词

引用

@article{arxiv.2601.05470,
  title  = {ROAP: A Reading-Order and Attention-Prior Pipeline for Optimizing Layout Transformers in Key Information Extraction},
  author = {Tingwei Xie and Jinxin He and Yonghong Song},
  journal= {arXiv preprint arXiv:2601.05470},
  year   = {2026}
}

备注

10 pages, 4 figures, 4 tables