探索大型多模态模型在密集文本上的能力
计算与语言
2024-05-14 v1 人工智能
摘要
虽然大型多模态模型(LMM)在多模态任务中取得了显著进展,但它们在涉及密集文本内容的任务中的能力仍有待充分探索。密集文本承载着重要信息,常出现在文档、表格和产品描述中。理解密集文本使我们能够获取更准确的信息,从而辅助做出更好的决策。为了进一步探索LMM在复杂文本任务中的能力,我们提出了包含17万对问答的DT-VQA数据集。在本文中,我们对GPT4V、Gemini以及各种开源LMM在我们的数据集上进行了全面评估,揭示了它们的优势与不足。此外,我们评估了两种LMM策略的有效性:提示工程和下游微调。我们发现,即使使用自动标注的训练数据集,也能显著提升模型性能。我们希望这项研究能推动LMM在密集文本任务中的研究。代码将发布在https://github.com/Yuliang-Liu/MultimodalOCR。
引用
@article{arxiv.2405.06706,
title = {Exploring the Capabilities of Large Multimodal Models on Dense Text},
author = {Shuo Zhang and Biao Yang and Zhang Li and Zhiyin Ma and Yuliang Liu and Xiang Bai},
journal= {arXiv preprint arXiv:2405.06706},
year = {2024}
}