中文

mPLUG-Owl3:面向多模态大语言模型的长图像序列理解

计算机视觉与模式识别 2024-08-14 v2 人工智能 计算与语言 机器学习

摘要

多模态大语言模型(MLLMs)在执行各种单图像任务指令方面展现了卓越能力。尽管取得了这一进展,但在建模长图像序列方面仍存在重大挑战。在本工作中,我们引入了多功能多模态大语言模型mPLUG-Owl3,增强了在包含检索图像-文本知识、交错图像-文本和长视频的场景中的长图像序列理解能力。具体而言,我们提出了新颖的超注意力块,以高效地将视觉和语言整合到统一的语言引导语义空间中,从而促进扩展多图像场景的处理。广泛的实验结果表明,mPLUG-Owl3在单图像、多图像和视频基准测试中,在相似规模的模型中达到了最先进性能。此外,我们提出了一项具有挑战性的长视觉序列评估——抗干扰性,以评估模型在干扰中保持聚焦的能力。最后,通过所提出的架构,mPLUG-Owl3在超长视觉序列输入上展现了卓越性能。我们希望mPLUG-Owl3能为更高效、更强大的多模态大语言模型的发展做出贡献。

关键词

引用

@article{arxiv.2408.04840,
  title  = {mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models},
  author = {Jiabo Ye and Haiyang Xu and Haowei Liu and Anwen Hu and Ming Yan and Qi Qian and Ji Zhang and Fei Huang and Jingren Zhou},
  journal= {arXiv preprint arXiv:2408.04840},
  year   = {2024}
}