面向细粒度多页文档理解的全景聚焦
计算机视觉与模式识别
2024-05-24 v1
摘要
现代多模态大语言模型(LVLMs)仍在实现细粒度文档理解方面存在挑战,例如对用户感兴趣的感兴趣区域执行 OCR/翻译/描述、需要整个页面上下文的任务,甚至需要跨多个页面的任务。为此,本文提出了 Fox,一个有效的管道、混合数据和调优策略,促进 LVLMs 在单页/多页文档上实现全景聚焦。我们提出了一种新任务,通过使 LVLMs 在文档级别区域注意力来提升文档理解,例如将完整页面 OCR 重新定义为前景聚焦。我们使用多个视觉词汇表提取交错文档页面(例如包含图片的页面)的视觉混合知识。同时,我们将跨词汇表的视觉数据渲染为催化剂,以实现多个视觉词汇表的全面反应和文档内图表理解。进一步地,无需修改多个视觉词汇表的权重,上述催化的细粒度理解能力即可高效地调优到多页文档上,使模型在无格式和无页面限制的方式下能够在文档的任何位置聚焦。此外,我们构建了一个包含 9 个细粒度子任务(例如区域级 OCR/总结、颜色引导 OCR)的基准数据集,以推动社区的文档分析。实验结果验证了我们模型的优越性。
引用
@article{arxiv.2405.14295,
title = {Focus Anywhere for Fine-grained Multi-page Document Understanding},
author = {Chenglong Liu and Haoran Wei and Jinyue Chen and Lingyu Kong and Zheng Ge and Zining Zhu and Liang Zhao and Jianjian Sun and Chunrui Han and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2405.14295},
year = {2024}
}