Zoom-Refine:通过局部缩放与自精炼增强高分辨率多模态理解
计算机视觉与模式识别
2025-08-12 v2
摘要
多模态大语言模型 (MLLM) 常常难以准确解析高分辨率图像,而细粒度细节对于复杂的视觉理解至关重要。为解决这一问题,我们引入了 Zoom-Refine,一种无需训练的新方法,旨在增强 MLLM 的能力。Zoom-Refine 通过局部缩放和自精炼的协同过程进行操作。在局部缩放步骤中,Zoom-Refine 利用 MLLM 对输入查询提供初步响应,并通过预测边界框坐标来识别与任务最相关的图像区域。在自精炼步骤中,Zoom-Refine 随后将高分辨率裁剪图像(由局部缩放识别)中的细粒度细节与其初始推理相结合,以重新评估并精炼其初步响应。我们的方法利用了 MLLM 在空间定位、上下文推理和比较分析方面的固有能力,无需额外训练或外部专家。综合实验证明了 Zoom-Refine 在两个具有挑战性的高分辨率多模态基准上的有效性。代码可在 \href{https://github.com/xavier-yu114/Zoom-Refine}{\color{magenta}github.com/xavier-yu114/Zoom-Refine} 获取
引用
@article{arxiv.2506.01663,
title = {Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement},
author = {Xuan Yu and Dayan Guan and Yanfeng Gu},
journal= {arXiv preprint arXiv:2506.01663},
year = {2025}
}
备注
Code is available at https://github.com/xavier-yu114/Zoom-Refine