中文

PixelRefer:基于任意颗粒度的时空对象指代统一框架

计算机视觉与模式识别 2025-11-04 v2

摘要

多模态大语言模型(MLLM)已展现出强大的面向开放世界的视觉理解能力。然而,大多数现有 MLLM 主要关注整体、场景级的理解,往往忽视了针对细粒度、对象导向推理的需求。本文提出 PixelRefer,一个统一的区域级 MLLM 框架,使其能够在图像和视频上进行高级的细粒度理解,覆盖用户指定的区域。基于观察到 LLM 注意力主要集中在对象级 token 上的事实,我们提出了比例自适应对象标记器(SAOT),用于从自由形式的区域生成紧凑且语义丰富的对象表示。我们的分析表明,全局视觉 token 主要在 LLM 的早期层中发挥作用,这启发我们设计了 PixelRefer-Lite 高效变体,采用对象中心融合模块预先将全局上下文融合到对象 token 中。这产生了一个轻量级仅对象框架,显著减少了计算成本,同时保持了高语义保真度。为促进细粒度指令调优,我们策划了 PixelRefer-2.2M 数据集。广泛的实验在多个基准测试上验证了 PixelRefer 在更少的训练样本下即可达到领先性能,而 PixelRefer-Lite 在效率方面实现了竞争的准确率。

关键词

引用

@article{arxiv.2510.23603,
  title  = {PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity},
  author = {Yuqian Yuan and Wenqiao Zhang and Xin Li and Shihao Wang and Kehan Li and Wentong Li and Jun Xiao and Lei Zhang and Beng Chin Ooi},
  journal= {arXiv preprint arXiv:2510.23603},
  year   = {2025}
}

备注

22 pages, 13 figures