中文

PS³:将视觉预训练扩展至4K分辨率

计算机视觉与模式识别 2025-08-05 v2

摘要

高分辨率视觉细节的感知对于日常任务至关重要。然而,当前视觉预训练仍受限于低分辨率(例如 378×378 像素),这是由于处理更大图像的二次计算成本所致。我们提出 PS³(Progressive Sampling and Scaling),通过选择性处理局部区域并与局部详细描述进行对比,实现了以近乎恒定成本扩展到4K分辨率的CLIP式视觉预训练。经过预训练的 PS³ 能够在低分辨率下编码全局图像,同时根据局部显著性或与文本提示的相关性选择性处理局部高分辨率区域。当将 PS³ 应用于多模态大语言模型(MLLM)时,得到的模型命名为 VILA-HD,显著优于未进行高分辨率视觉预训练的基线模型(如 AnyRes 和 S²),在使用最高可达 4.3 倍更少的 token 的情况下,实现了对高分辨率视觉感知的显著提升。PS³ 也为 VILA-HD 带来了引人注目的扩展属性,包括无成本地提升分辨率以及通过提高推理时计算资源来获得更好性能。与最先进的模型(如 SigLIP2、感知编码器、NVILA 和 Qwen2.5-VL)相比,PS³ 和 VILA-HD 在多个基准测试中均表现更优,同时相较于最新的 token 剪枝方法也实现了更好的效率。最后,我们发现当前基准测试并不要求4K分辨率感知,这促使我们提出 4KPro,这是一个4K分辨率图像问答基准测试,VILA-HD 在该基准测试上超越了所有以前的 MLLM,包括对 GPT-4o 提升 16.1%,对 Qwen2.5-VL 提升 7.5%。

关键词

引用

@article{arxiv.2503.19903,
  title  = {Scaling Vision Pre-Training to 4K Resolution},
  author = {Baifeng Shi and Boyi Li and Han Cai and Yao Lu and Sifei Liu and Marco Pavone and Jan Kautz and Song Han and Trevor Darrell and Pavlo Molchanov and Hongxu Yin},
  journal= {arXiv preprint arXiv:2503.19903},
  year   = {2025}
}

备注

CVPR 2025. Project Page: https://nvlabs.github.io/PS3