LLaVA-Read:提升多模态语言模型的阅读能力
计算机视觉与模式识别
2024-07-30 v1 人工智能
摘要
大型多模态语言模型在理解和操作图像方面展现出惊人的能力,但许多模型在理解图像中嵌入的大量文本内容方面仍感困难,主要由于其文本识别和布局理解能力有限。为此,我们进行探索性分析,揭示了经典视觉编码器在视觉文本理解方面的局限。因此,我们提出 LLaVA-Read,一种利用双视觉编码器搭配视觉文本编码器的多模态大语言模型。我们的模型在各种富文本图像理解任务中超越了现有最先进模型,展示了对图像中文本内容的增强理解。我们的研究表明,视觉文本理解仍是一个开放性挑战,而高效的视觉文本编码器对于未来成功的多模态系统至关重要。
引用
@article{arxiv.2407.19185,
title = {LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models},
author = {Ruiyi Zhang and Yufan Zhou and Jian Chen and Jiuxiang Gu and Changyou Chen and Tong Sun},
journal= {arXiv preprint arXiv:2407.19185},
year = {2024}
}
备注
NeurIPS 2024 Under Review