MR-MLLM: 多模态理解与视觉感知的相互强化
计算机视觉与模式识别
2024-06-25 v1
摘要
近年来,多模态大语言模型(MLLMs)在视觉问答和常识推理等任务中展现出卓越的能力,而视觉感知模型在检测和分割等感知任务中取得了显著进展。然而,MLLMs主要聚焦于高层次的图像-文本解释,难以处理细粒度的视觉理解;而视觉感知模型由于模型容量有限,常因开放世界分布迁移而受限。为克服这些挑战,本文提出了相互强化的多模态大语言模型(MR-MLLM),一种新型框架,通过协同增强视觉感知与多模态理解。首先,提出了共享查询融合机制,将视觉模型中详细的视觉输入与语言模型的语言深度调和,实现多模态理解与视觉感知的协同增强。其次,提出感知增强的跨模态集成方法,融合视觉感知输出中的新型模态(如目标检测边界框),以捕捉细微视觉元素,从而丰富视觉与文本数据的理解。此外,创新性的感知嵌入式提示生成机制被提出,将感知信息嵌入语言模型的提示中,实现上下文与感知的精准对齐,以实现更准确的多模态解释。大量实验表明,MR-MLLM在各种多模态理解和视觉感知任务中均表现出优异性能,尤其是在需要精细视觉感知和细粒度语言理解的场景中表现尤为突出。
引用
@article{arxiv.2406.15768,
title = {MR-MLLM: Mutual Reinforcement of Multimodal Comprehension and Vision Perception},
author = {Guanqun Wang and Xinyu Wei and Jiaming Liu and Ray Zhang and Yichi Zhang and Kevin Zhang and Maurice Chong and Shanghang Zhang},
journal= {arXiv preprint arXiv:2406.15768},
year = {2024}
}
备注
14 pages, 8 figures