中文

无需缩放:面向细粒度多模态感知的区域到图像蒸馏

计算机视觉与模式识别 2026-02-17 v2 人工智能 计算与语言 机器学习

摘要

多模态大语言模型在广泛的视觉理解方面表现出色,但在细粒度感知方面仍然存在困难,因为决定性证据很小且容易被全局上下文淹没。最近的“思考与图像”方法通过在推理过程中迭代地放大和缩小感兴趣区域来缓解这一问题,但由于重复的工具调用和视觉重新编码而导致高延迟。为了解决这个问题,我们提出了区域到图像蒸馏,它将缩放从推理时的工具转变为训练时的原语,从而将智能体缩放的好处内化到MLLM的单次前向传播中。具体来说,我们首先放大到微裁剪区域,让强大的教师模型生成高质量的VQA数据,然后将这种基于区域的监督蒸馏回完整图像。在此类数据上训练后,较小的学生模型无需使用工具即可提高“单次浏览”的细粒度感知能力。为了严格评估这种能力,我们进一步提出了ZoomBench,一个包含845个VQA数据的混合标注基准,涵盖六个细粒度感知维度,以及一个量化全局-区域“缩放差距”的双视角协议。实验表明,我们的模型在多个细粒度感知基准上取得了领先性能,并且在视觉推理和GUI代理等基准上也提高了通用多模态认知能力。我们进一步讨论了何时“思考与图像”是必要的,以及何时其收益可以蒸馏到单次前向传播中。我们的代码可在 https://github.com/inclusionAI/Zooming-without-Zooming 获取。

关键词

引用

@article{arxiv.2602.11858,
  title  = {Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception},
  author = {Lai Wei and Liangbo He and Jun Lan and Lingzhong Dong and Yutong Cai and Siyuan Li and Huijia Zhu and Weiqiang Wang and Linghe Kong and Yue Wang and Zhuosheng Zhang and Weiran Huang},
  journal= {arXiv preprint arXiv:2602.11858},
  year   = {2026}
}