中文

无训练、通用框架提升高分辨率图像上的多模态大语言模型性能

计算机视觉与模式识别 2025-07-15 v1 人工智能

摘要

多模态大语言模型(MLLMs)在视觉语言理解、推理和生成方面展现出惊人的能力,但在处理需要对高分辨率图像进行精细定位和推理的任务时表现不佳。这种限制源于MLLMs使用固定图像分辨率进行微调以适配其预训练图像编码器的事实。因此,直接将高分辨率图像输入MLLMs会导致泛化性差,而downsampling这些图像虽然确保了一致性,却会牺牲细粒度视觉细节,从而降低性能。为解决这一挑战,我们提出了Extract Candidate then Predict(ECP),一个 novel 的无训练、无任务依赖的两阶段框架,用于增强MLLMs在高分辨率图像上的性能。ECP的关键直觉在于,尽管MLLMs在处理高分辨率图像时存在困难,但其对downsampled图像的预测仍包含隐式的定位线索。通过首先使用粗糙预测识别候选区域,然后基于候选区域进行最终预测,ECP有效地保留了细粒度细节,同时缓解了高分辨率数据所带来的挑战。我们在4K GUI grounding和4K、8K MLLM perception上验证了该框架,分别实现了+21.3%、+5.8%、+5.2%的绝对提升,证明了其有效性。代码可在 https://github.com/yenncye/ECP 获取。

关键词

引用

@article{arxiv.2507.10202,
  title  = {A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images},
  author = {Jaeseong Lee and Yeeun Choi and Heechan Choi and Hanjung Kim and Seonjoo Kim},
  journal= {arXiv preprint arXiv:2507.10202},
  year   = {2025}
}

备注

Accepted at CVPR 2025 Workshop on Emergent Visual Abilities and Limits of Foundation Models