mPLUG-DocOwl:面向文档理解的模块化多模态大语言模型
计算与语言
2023-07-07 v1 人工智能
摘要
文档理解指从网页等各类数字文档中自动提取、分析与理解信息。现有的多模态大语言模型(MLLMs),包括 mPLUG-Owl,已在浅层无 OCR 文本识别中展现出有前景的零样本能力,表明其具备无 OCR 文档理解的潜力。然而,若无领域内训练,这些模型往往忽略细粒度 OCR 特征,如复杂表格或大面积文本块,而这些对于无 OCR 文档理解至关重要。本文中,我们提出基于 mPLUG-Owl 的 mPLUG-DocOwl 用于无 OCR 文档理解。具体而言,我们首先构建了一个涵盖广泛视觉-文本理解任务的指令微调数据集。随后,通过在我们统一的指令微调策略下,联合在纯语言、通用视觉-语言及文档指令微调数据集上训练模型,增强了无 OCR 文档理解能力。我们还构建了无 OCR 文档指令理解评测集 LLMDoc,以更好地比较模型在指令遵循与文档理解上的能力。实验结果表明,我们的模型优于现有多模态模型,展现出强大的文档理解能力。此外,无需特定微调,mPLUG-DocOwl 在各种下游任务上泛化良好。我们的代码、模型、训练数据与评测集发布于 https://github.com/X-PLUG/mPLUG-DocOwl。
引用
@article{arxiv.2307.02499,
title = {mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding},
author = {Jiabo Ye and Anwen Hu and Haiyang Xu and Qinghao Ye and Ming Yan and Yuhao Dan and Chenlin Zhao and Guohai Xu and Chenliang Li and Junfeng Tian and Qian Qi and Ji Zhang and Fei Huang},
journal= {arXiv preprint arXiv:2307.02499},
year = {2023}
}
备注
10 pages, 8 figures