EAGLE:面向多模态大语言模型的高效任意指代视觉提示理解
计算机视觉与模式识别
2024-09-27 v2
摘要
近期,多模态大语言模型(MLLMs)因其卓越的内容推理与指令跟随能力而引发了极大的研究兴趣。为了有效地向 MLLM 发出指令,除了常规的语言表达外,通过在图像上用画笔涂抹来指代对象的做法因其能有效将用户意图与特定图像区域对齐,已成为一种流行工具(被称为“指代视觉提示”)。为了适应最常见的指代视觉提示,即点、框和掩码,现有方法首先利用专门的模块对这些提示所指示的高亮区域进行特征编码以捕获其语义。随后,通过在精心整理的多模态指令数据集上进行微调,将这些编码后的区域特征适配到 MLLM 中。然而,此类设计存在架构冗余问题。此外,在现实场景中遇到多种任意指代视觉提示时,它们在有效泛化方面面临挑战。为了解决上述问题,我们提出了 EAGLE,一种新型 MLLM,与现有方法相比,它以更少的训练代价实现了对任意指代视觉提示的理解。具体而言,我们的 EAGLE 将指代视觉提示保持为其在给定图像上渲染的彩色色块的固有格式,以进行指令微调。我们的方法将指代视觉提示嵌入为传达特定空间区域的空间概念,使 MLLM 能够理解这些区域,而这些区域的语义理解源自 MLLM 本身。此外,我们还提出了一种几何无关学习范式(GAL),以进一步将 MLLM 的区域级理解与指代视觉提示的具体格式解耦。我们进行了大量实验以证明所提方法的有效性。
引用
@article{arxiv.2409.16723,
title = {EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models},
author = {Jiacheng Zhang and Yang Jiao and Shaoxiang Chen and Jingjing Chen and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2409.16723},
year = {2024}
}