中文

BLIVA:一种用于更好处理富文本视觉问答的简单多模态大语言模型

计算机视觉与模式识别 2023-12-19 v3 人工智能 计算与语言 机器学习

摘要

视觉语言模型(VLM)通过融入视觉理解能力对大语言模型(LLM)进行扩展,在解决开放式视觉问答(VQA)任务方面已展现出显著进展。然而,这些模型无法准确解读嵌入文本的图像,而这在真实场景中是常见现象。从图像中提取信息的标准流程通常涉及学习一组固定的查询嵌入。这些嵌入旨在封装图像上下文,并随后用作 LLM 中的软提示输入。但该过程受限于词元数量,可能削弱对富含文本上下文的场景的识别能力。为改进上述模型,本研究提出 BLIVA:一种带视觉助手的 InstructBLIP 增强版本。BLIVA 融合了 InstructBLIP 的查询嵌入,并受 LLaVA 启发直接将编码后的图像块嵌入投影到 LLM 中。该方法有助于模型捕捉在查询解码过程中可能遗漏的精细细节。实证表明,我们的模型 BLIVA 在处理富文本 VQA 基准(OCR-VQA 基准上提升达 17.76%)和通用(非特定富文本)VQA 基准(视觉空间推理基准上提升达 7.9%)时性能显著增强,相较于基线 InstructBLIP 在综合多模态 LLM 基准(MME)上取得 17.72% 的整体提升。BLIVA 展现出解码真实世界图像的能力,无论是否存在文本。为展示 BLIVA 赋能的广泛工业应用,我们使用一个由 YouTube 缩略图及跨越 11 个多样类别的问答对组成的新数据集对模型进行评估。我们的代码与模型可在 https://github.com/mlpc-ucsd/BLIVA 免费获取。

关键词

引用

@article{arxiv.2308.09936,
  title  = {BLIVA: A Simple Multimodal LLM for Better Handling of Text-Rich Visual Questions},
  author = {Wenbo Hu and Yifan Xu and Yi Li and Weiyue Li and Zeyuan Chen and Zhuowen Tu},
  journal= {arXiv preprint arXiv:2308.09936},
  year   = {2023}
}

备注

Accepted at AAAI Conference on Artificial Intelligence (AAAI-24)