中文

原生视觉理解:解决视觉语言模型中的分辨率困境

计算机视觉与模式识别 2025-06-17 v1

摘要

视觉语言模型 (Vision-Language Models, VLMs) 在处理真实世界图像的多样分辨率和宽高比时面临重大挑战,因为大多数现有模型依赖固定的低分辨率输入。虽然近期研究探索了集成原生分辨率视觉编码以提升模型性能的做法,但这些努力在开源社区中仍零散,缺乏系统性框架。此外,现有基准测试在评估VLMs在不同视觉条件下的表现时不足,常忽视分辨率这一关键因素。为解决源于模型设计和基准测试限制的“分辨率困境”,我们提出RC-Bench—a 一个新颖的基准测试,旨在系统性地评估VLMs在极端视觉条件下的能力,重点关注分辨率和宽高比的变化。同时,我们提出NativeRes-LLaVA,一个开源训练框架,使VLMs能够有效处理其原生分辨率和宽高比的图像。基于RC-Bench和NativeRes-LLaVA,我们对现有视觉编码策略进行了全面实验。结果表明,原生分辨率视觉编码显著提升了VLMs在RC-Bench以及其他以分辨率为核心的基准测试上的性能。代码已公开于https://github.com/Niujunbo2002/NativeRes-LLaVA。

关键词

引用

@article{arxiv.2506.12776,
  title  = {Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models},
  author = {Junbo Niu and Yuanhong Zheng and Ziyang Miao and Hejun Dong and Chunjiang Ge and Hao Liang and Ma Lu and Bohan Zeng and Qiahao Zheng and Conghui He and Wentao Zhang},
  journal= {arXiv preprint arXiv:2506.12776},
  year   = {2025}
}