中文

MAGIC:面向视觉语言模型的多模态对齐与 grounding-aware 指令核心集

计算机视觉与模式识别 2026-05-26 v1 计算与语言

摘要

大型视觉语言模型 (LVLMs) 的指令调谐越来越依赖大规模多模态语料,但这些数据集包含大量冗余样本、低视觉依赖性以及对多模态推理行为的覆盖不平衡。因此,均匀抽样或基于得分的选择往往会导致次优的训练子集。我们引入了 MAGIC,这是一种无需训练、仅前向传播的核心集选择方法,用于构建紧凑且在行为上忠实的子集,以进行多模态指令调谋。MAGIC 基于来自预训练 VLM 的三个内在信号:多模态收益,衡量视觉输入带来的可能性提升;桥接相关性,捕捉答案标记在视觉标记上grounding 的锐度;技能-神经元签名,通过每个样本激活的顶级前馈神经元来刻画其功能计算。MAGIC 将这些信号组成三阶段管道:过滤低收益样本、按规范化质量目标排序候选者、对离散神经元签名进行分桶预算分配以保持潜在的多模态技能覆盖。该方法避免了反向传播、辅助选择器训练以及在连续激活空间中进行的高成本聚类,同时保持高效且易于集成到现有 VLM 中。在 LLaVA-665K 和 Vision-Flan 数据集上,以及对大目标模型的迁移设置(LLaVA-1.5-7B 和 -13B),MAGIC 在匹配的 20% 预算下始终优于强大的基线:它在 LLaVA-665K 上实现 100.3% 的相对性能,在 Vision-Flan-186K 上实现 101.6% 的相对性能,同时将运行时间缩短 73.7%。

关键词

引用

@article{arxiv.2605.26004,
  title  = {MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models},
  author = {Shristi Das Biswas and Kaushik Roy},
  journal= {arXiv preprint arXiv:2605.26004},
  year   = {2026}
}