中文

CARES:面向视觉语言模型的上下文感知分辨率选择器

计算机视觉与模式识别 2026-03-23 v2 人工智能 机器学习

摘要

大型视觉语言模型(VLMs)通常在原生或高分辨率下处理图像,以保持在各种任务上的有效性。这会导致视觉标记占总标记的 97-99%,即使低分辨率图像就会足以。我们引入 CARES—a \textbf{C}ontext-\textbf{A}ware \textbf{R}esolution \textbf{S}elector,一种轻量级预处理模块,给定图像查询对,预测 \emph{minimal} 足以的输入分辨率。CARES 使用一个紧凑的 VLM(350M)提取特征并预测目标预训练 VLM 的响应何时收敛于其在正确回答问题方面的最佳能力。虽然 CARES 作为在一组可选分辨率上的离散分类器进行训练,但 CARES 在推理时对连续分辨率进行插值,以实现细粒度控制。在覆盖文档和自然图像的五个多模态基准测试中,以及各种目标 VLMs 上,CARES 在保持任务性能的同时,将计算减少最高可达 80%。

关键词

引用

@article{arxiv.2510.19496,
  title  = {CARES: Context-Aware Resolution Selector for VLMs},
  author = {Moshe Kimhi and Nimrod Shabtay and Raja Giryes and Chaim Baskin and Eli Schwartz},
  journal= {arXiv preprint arXiv:2510.19496},
  year   = {2026}
}