mPLUG-DocOwl2:面向无 OCR 多页文档理解的高分辨率压缩
计算机视觉与模式识别
2024-09-10 v2
摘要
多模态大语言模型(MLLMs)通过提高文档图像的支持分辨率,实现了极具前景的无 OCR 文档理解性能。然而,这是以单张文档图像生成数千个视觉 token 为代价的,导致 GPU 内存消耗过大和推理时间变慢,在多页文档理解中尤为明显。在本工作中,为了应对这些挑战,我们提出了一个高分辨率 DocCompressor 模块,在低分辨率全局视觉特征的引导下,将每张高分辨率文档图像压缩为 324 个 token。借助该压缩模块,为增强多页文档理解能力并平衡 token 效率与问答性能,我们在三阶段训练框架下开发了 DocOwl2:单图像预训练、多图像继续预训练和多任务微调。DocOwl2 在多页文档理解基准上取得了新的 SOTA,并将首 token 延迟降低了 50% 以上,展示了在多页问答、带证据页的解释以及跨页结构理解方面的先进能力。此外,与在相似数据上训练的单图像 MLLMs 相比,我们的 DocOwl2 以不到 20% 的视觉 token 实现了相当的单页理解性能。我们的代码、模型和数据已在 https://github.com/X-PLUG/mPLUG-DocOwl/tree/main/DocOwl2 公开。
关键词
引用
@article{arxiv.2409.03420,
title = {mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding},
author = {Anwen Hu and Haiyang Xu and Liang Zhang and Jiabo Ye and Ming Yan and Ji Zhang and Qin Jin and Fei Huang and Jingren Zhou},
journal= {arXiv preprint arXiv:2409.03420},
year = {2024}
}
备注
15 pages, 7 figures