中文

探索大型多模态模型在密集文本上的能力

计算与语言 2024-05-14 v1 人工智能

摘要

虽然大型多模态模型(LMM)在多模态任务中取得了显著进展,但它们在涉及密集文本内容的任务中的能力仍有待充分探索。密集文本承载着重要信息,常出现在文档、表格和产品描述中。理解密集文本使我们能够获取更准确的信息,从而辅助做出更好的决策。为了进一步探索LMM在复杂文本任务中的能力,我们提出了包含17万对问答的DT-VQA数据集。在本文中,我们对GPT4V、Gemini以及各种开源LMM在我们的数据集上进行了全面评估,揭示了它们的优势与不足。此外,我们评估了两种LMM策略的有效性:提示工程和下游微调。我们发现,即使使用自动标注的训练数据集,也能显著提升模型性能。我们希望这项研究能推动LMM在密集文本任务中的研究。代码将发布在https://github.com/Yuliang-Liu/MultimodalOCR。

关键词

引用

@article{arxiv.2405.06706,
  title  = {Exploring the Capabilities of Large Multimodal Models on Dense Text},
  author = {Shuo Zhang and Biao Yang and Zhang Li and Zhiyin Ma and Yuliang Liu and Xiang Bai},
  journal= {arXiv preprint arXiv:2405.06706},
  year   = {2024}
}