VEGA: 视觉语言大模型中的交错图像文本理解
计算机视觉与模式识别
2024-06-17 v1 人工智能
计算与语言
摘要
多模态大模型(MLLMs)的快速发展展现出了处理融合视觉与语言任务的强大能力。然而,大多数现有模型和基准仅针对视觉和文本上下文范围有限的场景。这些模型在面对复杂理解任务时常常不足,这类任务涉及大量无关且可能误导性的信息,同时包含图像和文本两种形式。为弥合这一差距,我们引入了一种更具挑战性的任务,即交错图像文本理解(Interleaved Image-Text Comprehension, IITC)。该任务挑战模型识别并忽略图像和文本中冗余元素,以准确回答问题并遵循复杂指令以定位相关图像。为支持该任务,我们构建了一个针对科学内容的新 VEGA 数据集,并设计了一个子任务图像文本关联(Image-Text Association, ITA),以细化图像文本关联技能。我们的评估表明,四个领先的封闭源模型以及使用 VEGA 的各种开源模型均受到严峻考验。即便是 Gemini-1.5-pro 和 GPT4V 等最先进模型也仅取得有限成功。通过采用多任务、多尺度 post-training 策略,我们为 MLLMs 在 IITC 任务上建立了稳健的基线,实现了图像关联的 85.8% 准确率和 0.508 的 Rouge 分数。这些结果验证了该数据集在提升 MLLMs 处理细粒度图像文本理解能力方面的有效性。
引用
@article{arxiv.2406.10228,
title = {VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models},
author = {Chenyu Zhou and Mengdan Zhang and Peixian Chen and Chaoyou Fu and Yunhang Shen and Xiawu Zheng and Xing Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2406.10228},
year = {2024}
}
备注
Project Page: https://zhourax.github.io/VEGA/