基于频率调制的视觉恢复:面向 Matryoshka 大多模态模型
计算机视觉与模式识别
2026-03-13 v1 计算与语言
摘要
大型多模态模型(LMMs)在面对不同计算预算时难以适应大量视觉标记的变化。先前的方法尝试在 LLM 之前或内部减少视觉标记的数量,但不可避免地导致视觉语义丢失。为此,我们引入 FMVR(Frequency-Modulated Visual Restoration),一种即插即用且极其简单的频率调制视觉恢复策略,以提升 LMM 在视觉标记减少下的推理能力。具体而言,FMVR 通过 AvgPool 和 MaxPool 将较少视觉标记的视觉表示分解为低频和高频成分。随后,这些频率成分通过轻量可学习参数进行调制。AvgPool 的高频成分充当灵敏度滤波器,以增强视觉语义的灵敏度;MaxPool 的低频成分充当反灵敏度滤波器,以强化弱视觉语义。这使得能够保持由少量视觉标记主导的视觉语义,并恢复被稀释的视觉语义。此外,我们将 FMVR 注入 Matryoshka Representation Learning,以学习粗到细的视觉标记集合,从而在推理期间实现对视觉标记数量的弹性调整,同时保持接近原始性能。跨越 10 个基于图像的基准和 4 个基于视频的基准的实验表明,FMVR-LLaVA 将 LLaVA-1.5-7B 的 FLOPs 降低 89%,而几乎保持原始准确率的 100%。该代码将开源。
引用
@article{arxiv.2603.11220,
title = {Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models},
author = {Qingtao Pan and Zhihao Dou and Shuo Li},
journal= {arXiv preprint arXiv:2603.11220},
year = {2026}
}