中文

用于视觉感知与多模态理解的参数反转图像金字塔网络

计算机视觉与模式识别 2025-07-28 v1 计算与语言

摘要

图像金字塔在顶级方法中被广泛采用,以获取多尺度特征用于精确的视觉感知与理解。然而,当前的图像金字塔使用相同的大规模模型来处理多种分辨率的图像,导致计算成本显著增加。为了应对这一挑战,我们提出了一种新颖的网络架构,称为参数反转图像金字塔网络 (PIIP)。具体而言,PIIP 使用预训练模型 (ViTs 或 CNNs) 作为分支来处理多尺度图像,其中更高分辨率的图像由更小的网络分支处理,以平衡计算成本与性能。为了整合来自不同空间尺度的信息,我们进一步提出了一种新颖的跨分支特征交互机制。为了验证 PIIP,我们将其应用于各种感知模型以及一个名为 LLaVA 的代表性多模态大语言模型,并在目标检测、分割、图像分类和多模态理解等各种任务上进行了大量实验。PIIP 以更低的计算成本实现了优于单分支和现有多种分辨率方法的性能。当应用于大规模视觉基础模型 InternViT-6B 时,PIIP 仅使用原始计算量的 40%-60%,即可在检测和分割上将性能提升 1%-2%,最终在 MS COCO 上达到 60.0 box AP,在 ADE20K 上达到 59.7 mIoU。对于多模态理解,我们的 PIIP-LLaVA 仅使用 2.8M 训练数据,就在 TextVQA 上达到了 73.0% 的准确率,在 MMBench 上达到了 74.5%。我们的代码已在 https://github.com/OpenGVLab/PIIP 发布。

关键词

引用

@article{arxiv.2501.07783,
  title  = {Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding},
  author = {Zhaokai Wang and Xizhou Zhu and Xue Yang and Gen Luo and Hao Li and Changyao Tian and Wenhan Dou and Junqi Ge and Lewei Lu and Yu Qiao and Jifeng Dai},
  journal= {arXiv preprint arXiv:2501.07783},
  year   = {2025}
}