MoDA:用于指令微调 MLLM 中细粒度视觉定位的调制适配器
计算机视觉与模式识别
2025-06-03 v1 人工智能
机器学习
多媒体
摘要
近期,多模态大语言模型(MLLMs)通过将预训练视觉编码器与大语言模型(LLMs)相结合,在指令遵循任务上展现了出色的性能。然而,现有方法通常难以在复杂场景中定位细粒度的视觉概念。在本文中,我们提出了 MoDA(Modulation Adapter,调制适配器),这是一个轻量但有效的模块,旨在通过指令引导的调制来精炼预对齐的视觉特征。我们的方法遵循标准的 LLaVA 训练协议,包含两个阶段的过程:(1)通过冻结的视觉编码器和适配器层将图像特征对齐到 LLMs 输入空间,以及(2)在指令微调阶段使用 MoDA 适配器精炼这些特征。MoDA 采用基于 Transformer 的交叉注意力机制在已对齐的视觉 token 上生成调制掩码,从而基于语言指令强调语义相关的嵌入维度。然后,调制后的特征被传递给 LLM 以进行自回归语言生成。我们的实验评估表明,MoDA 改进了视觉定位并生成了更具上下文适宜性的响应,证明了其作为基于图像的 MLLM 通用增强方法的有效性。
引用
@article{arxiv.2506.01850,
title = {MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs},
author = {Wayner Barrios and Andrés Villa and Juan León Alcázar and SouYoung Jin and Bernard Ghanem},
journal= {arXiv preprint arXiv:2506.01850},
year = {2025}
}