DocPedia:在频域释放大型多模态模型能力以实现通用文档理解
计算机视觉与模式识别
2024-11-26 v4 人工智能
摘要
本工作提出 DocPedia,一种用于通用无 OCR 文档理解的新型大型多模态模型(LMM),能够解析分辨率高达 2,5602,560 的图像。不同于现有工作要么难以处理高分辨率文档、要么放弃大语言模型从而导致视觉或语言能力受限,我们的 DocPedia 直接在频域而非像素空间处理视觉输入。这一独特特性使 DocPedia 能用有限数量的视觉 token 捕捉更大量的视觉与文本信息。为持续增强模型的感知与理解能力,我们开发了双阶段训练策略,并丰富了覆盖多种文档类型的所有训练任务的指令与标注。在多个公开可用基准上进行的广泛定量与定性实验证实了联合学习感知与理解任务的相互增益。结果为我们的 DocPedia 相较其他方法的有效性与优越性能提供了进一步证据。
引用
@article{arxiv.2311.11810,
title = {DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding},
author = {Hao Feng and Qi Liu and Hao Liu and Jingqun Tang and Wengang Zhou and Houqiang Li and Can Huang},
journal= {arXiv preprint arXiv:2311.11810},
year = {2024}
}
备注
Accepted by Science China Information Sciences (SCIS)