填补 GAP:面向多模态大语言模型视觉推理的粒粒对齐范式
计算机视觉与模式识别
2026-05-26 v4 人工智能
机器学习
摘要
视觉潜在推理允许多模态大语言模型(MLLM)创建连续 token 形式的中间视觉证据,避免使用外部工具或图像生成器。然而,现有方法通常遵循输出即输入的潜在范式,导致提升不稳定。我们识别出一种特征空间不匹配,可能导致这种不稳定:主导视觉-潜在模型基于预规范 MLLM 并重用解码器隐藏状态作为预测潜在输入,尽管这些状态占据的显著不同于模型训练所消费的输入嵌入的显著不同规范范围(Xie 等,2025;Li 等,2026;Team 等,2026)。这种不匹配可能使直接潜在反馈不可靠。针对这一诊断,我们提出了 GAP,即面向视觉潜在建模的粒粒对齐范式。GAP 在三个层面上进行视觉潜在推理对齐:特征层面对齐通过轻量级 PCA 对齐的潜在头将解码器输出映射到输入兼容的视觉潜在表示;上下文层面对齐通过可检查的辅助视觉监督将潜在目标锚定;容量引导层面对齐则将潜在监督选择性地分配给基座 MLLM 困扰的示例。在 Qwen2.5-VL 7B 上,该模型实现了我们受监督变体中最好的平均综合感知和推理性能。推理时间干预探针进一步表明,生成的潜在表示提供了与仅添加 token 插槽无关的任务相关视觉信号。
引用
@article{arxiv.2605.12374,
title = {Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models},
author = {Yanting Miao and Yutao Sun and Dexin Wang and Mengyu Zhou and Pascal Poupart and Lei Lv and Qi Zhao and Li Wang and Hao Li and Xiaoxi Jiang and Guanjun Jiang},
journal= {arXiv preprint arXiv:2605.12374},
year = {2026}
}