中文

基于层次解耦重构高分辨率 MLLM 中的 Zoom-IN 方法——HiDe

计算机视觉与模式识别 2026-05-20 v2 人工智能

摘要

多模态大语言模型(MLLMs)在视觉理解任务中取得了显著进展。然而,其在高分辨率图像上的表现仍不理想。虽然现有方法常认为局限于感知约束,认为MLLMs难以识别小目标,因而采用"zoom in"策略以获得更佳细节,但我们的分析揭示了不同的原因:主要问题并非对象大小,而是由复杂背景干扰导致。我们通过一系列解耦实验系统性分析该"zoom in"操作,提出层次解耦框架(HiDe),这是一种无需训练的框架,利用Token-wise Attention Decoupling(TAD)解耦问题token以识别关键信息token,然后利用其注意力权重实现与目标视觉区域的精确对齐。随后,它采用Layout-Preserving Decoupling(LPD)将这些区域从背景中解耦,并重建保持关键空间布局的紧凑表示,同时消除背景干扰。HiDe在V*Bench、HRBench4K和HRBench8K上达到新SOTA,将V*Bench和HRBench8K上的Qwen2.5-VL 7B和InternVL3 8B提升至SOTA(在V*Bench上分别达到92.1%和91.6%),甚至超过了RL方法。经过优化后,HiDe比之前的无需训练方法节省了75%的内存。代码已提供于https://tennine2077.github.io/HiDe.github.io/。

关键词

引用

@article{arxiv.2510.00054,
  title  = {HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling},
  author = {Xianjie Liu and Yiman Hu and Yixiong Zou and Liang Wu and Jian Xu and Bo Zheng},
  journal= {arXiv preprint arXiv:2510.00054},
  year   = {2026}
}