Zoomer:面向黑盒多模态大语言模型的自适应图像焦点优化
计算机视觉与模式识别
2026-01-01 v2 人工智能
图像与视频处理
摘要
GPT-4o、Gemini Pro 和 Claude 3.5 等多模态大语言模型 (MLLM) 已能对文本和视觉输入进行统一推理,但在现实场景中,尤其是涉及小物体或精细空间上下文时,它们常产生幻觉。我们指出了这一缺陷的两个核心原因:缺乏区域自适应注意力,以及僵化的 token 预算导致统一降采样,造成关键信息丢失。为克服这些局限,我们提出了 Zoomer,一个为黑盒 MLLM 提供 token 高效、细节保留的图像表示的视觉提示框架。Zoomer 集成了 (1) 一个提示感知增强模块,用于突出语义相关区域;(2) 一个空间保留编排模式,用于维持物体关系;以及 (3) 一个预算感知策略,用于在全局上下文和局部细节之间自适应分配 token。在九个基准和三个商用 MLLM 上的大量实验表明,Zoomer 在将图像 token 使用量减少高达 67% 的同时,将准确率提升了高达 27%。我们的方法为在模型内部不可访问的设置中实现鲁棒、资源感知的多模态理解建立了一套原则性方法论。
引用
@article{arxiv.2505.00742,
title = {Zoomer: Adaptive Image Focus Optimization for Black-box MLLM},
author = {Jiaxu Qian and Chendong Wang and Yifan Yang and Chaoyun Zhang and Huiqiang Jiang and Xufang Luo and Yu Kang and Qingwei Lin and Anlan Zhang and Shiqi Jiang and Ting Cao and Tianjun Mao and Suman Banerjee and Guyue Liu and Saravan Rajmohan and Dongmei Zhang and Yuqing Yang and Qi Zhang and Lili Qiu},
journal= {arXiv preprint arXiv:2505.00742},
year = {2026}
}
备注
TMLR accepted