Q-Zoom: 查询感知自适应感知用于高效多模态大语言模型
计算机视觉与模式识别
2026-04-09 v1 人工智能
摘要
多模态大语言模型(MLLMs)需要高分辨率视觉输入以完成文档理解和密集场景感知等细粒度任务。然而,当前的全局分辨率缩放范式不加区分地用视觉冗余标记淹没二次自注意力机制,严重瓶颈化推理吞吐量,同时忽略空间稀疏性和查询意图。为克服此问题,我们提出Q-Zoom,一个查询感知的自适应高分辨率感知框架,以高效由粗到细的方式运行。首先,轻量级动态门控网络在粗粒度全局特征足够时安全绕过高分辨率处理。其次,对于需要细粒度感知的查询,自蒸馏区域提议网络(SD-RPN)直接从中间特征空间精确定位任务相关的感兴趣区域(RoI)。为高效优化这些模块,门控网络采用一致性感知生成策略推导确定性路由标签,而SD-RPN采用完全自监督蒸馏范式。连续的时空对齐方案和目标微调随后将密集局部RoI与粗粒度全局布局无缝融合。广泛实验表明Q-Zoom建立了主导的帕累托前沿。以Qwen2.5-VL-7B为主要测试平台,Q-Zoom在文档与OCR基准上将推理加速2.52倍,在高分辨率场景下加速4.39倍,同时匹配基线的峰值精度。此外,在配置为最大感知保真度时,Q-Zoom在这两个基准上分别超越基线峰值性能1.1%和8.1%。这些鲁棒的改进可无缝迁移至Qwen3-VL、LLaVA和新兴的基于强化学习的思考与图像模型。项目页面位于https://yuhengsss.github.io/Q-Zoom/。
引用
@article{arxiv.2604.06912,
title = {Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models},
author = {Yuheng Shi and Xiaohuan Pei and Linfeng Wen and Minjing Dong and Chang Xu},
journal= {arXiv preprint arXiv:2604.06912},
year = {2026}
}
备注
16 pages, 9 figures