中文

UniPixel:用于像素级视觉推理的统一指称与分割

计算机视觉与模式识别 2025-11-11 v4 人工智能

摘要

近年来,大型多模态模型(LMM)在作为通用多模态助手方面取得了显著成功,尤其聚焦于整体图像和视频语言理解。相反,对于扩大细粒度像素级理解能力的关注较少,此时模型需要实现视觉信号与语言语义之间的像素级对齐。一些先前研究将LMM应用于区域级描述和指称表达分割等相关任务。然而,这些模型仅能独立地执行指称或分割任务,无法将这些细粒度感知能力集成到视觉推理中。为弥合这一差距,我们提出UniPixel,一个能够灵活理解视觉提示输入并生成掩码导向响应的大型多模态模型。我们的模型区别于 seamless 集成像素级感知与通用视觉理解能力。具体而言,UniPixel处理视觉提示,按需生成相关掩码,并在后续推理中以这些中间指针为条件,实现细粒度像素级推理。我们的方法在涵盖多样任务的10个基准测试中取得有效性,包括像素级指称/分割和图像/视频中的对象级理解。还设计了一种新颖的PixelQA任务,联合要求指称、分割和问答,从而验证了方法的灵活性。

引用

@article{arxiv.2509.18094,
  title  = {UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning},
  author = {Ye Liu and Zongyang Ma and Junfu Pu and Zhongang Qi and Yang Wu and Ying Shan and Chang Wen Chen},
  journal= {arXiv preprint arXiv:2509.18094},
  year   = {2025}
}

备注

NeurIPS 2025 Camera Ready. Project Page: https://polyu-chenlab.github.io/unipixel/