中文

PRIMA:多图像视觉语言模型用于推理分段

计算机视觉与模式识别 2025-12-02 v2 人工智能 机器学习

摘要

尽管大型视觉语言模型(LVLMs)的能力取得了显著进展,现有的像素级对齐模型仅 operate in single-image settings,限制了其在多图像之间进行详细、精细比较的能力。相反,当前的多图像理解模型缺乏像素级对齐功能。本文通过引入多图像像素对齐推理任务,并提出PRIMA——一个集成像素级对齐与强大多图像推理能力的LVLM,以产生富有上下文信息的像素对齐解释。PRIMA的核心是SQuALE模块,它在将视觉标记注入紧凑查询式视觉标记以捕获跨图像关系上下文后,再与语言主干融合。为支持训练和评估,我们策划了M4SEG——一个新的多图像推理分段基准数据集,包含约74.4万个需要跨多图像进行精细视觉理解的问答对。PRIMA在召回率和S-IoU上分别 outperform state-of-the-art baselines,提升了7.83%和11.25%。消融研究进一步证明了SQuALE模块在捕获跨图像关系方面的有效性。

关键词

引用

@article{arxiv.2412.15209,
  title  = {PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation},
  author = {Muntasir Wahed and Kiet A. Nguyen and Adheesh Sunil Juvekar and Xinzhuo Li and Xiaona Zhou and Vedant Shah and Tianjiao Yu and Pinar Yanardag and Ismini Lourentzou},
  journal= {arXiv preprint arXiv:2412.15209},
  year   = {2025}
}

备注

Project page: https://plan-lab.github.io/prima