中文

用于视觉信息抽取的关系丰富型视觉文档生成器

计算机视觉与模式识别 2025-04-16 v1

摘要

尽管大型语言模型(LLMs)和多模态大型语言模型(MLLMs)在视觉文档理解(VDU)方面取得了进展,但由于布局的多样性和训练数据的有限性,从关系丰富的文档中进行视觉信息抽取(VIE)仍然具有挑战性。虽然现有的合成文档生成器试图解决数据稀缺问题,但它们要么依赖手动设计的布局和模板,要么采用基于规则的方法,从而限制了布局的多样性。此外,当前的布局生成方法仅关注拓扑模式而不考虑文本内容,使其无法用于生成内容和布局之间存在复杂关联的文档。在本文中,我们提出了一种关系丰富的视觉文档生成器(RIDGE),通过两阶段方法解决这些局限性:(1)内容生成,利用 LLMs 生成文档内容,采用精心设计的分层结构文本格式来捕获实体类别和关系;(2)内容驱动的布局生成,仅从易于获取的光学字符识别(OCR)结果中学习创建多样且合理的文档布局,无需人工标注。实验结果表明,我们的方法显著提升了文档理解模型在各种 VIE 基准上的性能。代码和模型将在 https://github.com/AI-Application-and-Integration-Lab/RIDGE 上提供。

关键词

引用

@article{arxiv.2504.10659,
  title  = {Relation-Rich Visual Document Generator for Visual Information Extraction},
  author = {Zi-Han Jiang and Chien-Wei Lin and Wei-Hua Li and Hsuan-Tung Liu and Yi-Ren Yeh and Chu-Song Chen},
  journal= {arXiv preprint arXiv:2504.10659},
  year   = {2025}
}

备注

CVPR 2025