ReLayout:通过布局增强预训练实现真实世界文档理解
计算机视觉与模式识别
2024-10-17 v2
摘要
近期的视觉丰富文档理解 (VrDU) 方法使用手动标注的语义组,这些语义组包含所有语义相关但未明显分组的单词。由于 OCR 工具无法自动识别此类分组, 我们认为当前 VrDU 方法不切实际。因此,我们提出了新的 VrDU 任务变体——真实世界视觉丰富文档理解 (ReVrDU),该任务不允许使用手动标注的语义组。我们还提出了一种符合 ReVrDU 场景的新方法 ReLayout,通过排列单词并将属于同一潜在语义组的单词表示拉近来捕获语义分组。我们的实验结果表明,在 ReVrDU 任务下,现有方法的性能会受到影响,而 ReLayout 显示出优异的性能。
引用
@article{arxiv.2410.10471,
title = {ReLayout: Towards Real-World Document Understanding via Layout-enhanced Pre-training},
author = {Zhouqiang Jiang and Bowen Wang and Junhao Chen and Yuta Nakashima},
journal= {arXiv preprint arXiv:2410.10471},
year = {2024}
}