聚焦关键位置:高分辨率裁剪检索以提高 VLMs 的效率
计算机视觉与模式识别
2026-03-19 v1 人工智能
摘要
视觉语言模型(VLMs)通常以原始高分辨率处理图像,导致在准确性和计算效率之间权衡:高分辨率输入捕获细节但产生高计算成本,而低分辨率输入更注重效率,可能遗漏关键视觉信息,如小文本。我们提出 AwaRes,一种按需空间的框架,通过在低分辨率全局视图上运行,利用工具调用仅检索给定查询所需的高分辨率片段来解决此准确性与效率之间的权衡。我们自动构建监督数据:评委比较低 vs. 高分辨率答案以标记是否需要裁剪,oracle grounding 模型定位正确答案的证据,将其映射到离散裁剪集合以形成多轮工具使用轨迹。我们采用 cold-start SFT 后跟随多轮 GRPO 进行训练,综合奖励函数结合语义答案正确性与显式裁剪成本惩罚。项目页面:https://nimrodshabtay.github.io/AwaRes
引用
@article{arxiv.2603.16932,
title = {Look Where It Matters: High-Resolution Crops Retrieval for Efficient VLMs},
author = {Nimrod Shabtay and Moshe Kimhi and Artem Spector and Sivan Haray and Ehud Rivlin and Chaim Baskin and Raja Giryes and Eli Schwartz},
journal= {arXiv preprint arXiv:2603.16932},
year = {2026}
}