中文

ReferDINO: 基于视觉 grounding 基础的 referring video object segmentation

计算机视觉与模式识别 2025-07-01 v2

摘要

指代视频对象分割(RVOS)旨在基于文本描述对视频中的目标对象进行分割。这一任务具有深层视觉-语言理解、像素级密集预测和时空推理等挑战。尽管近年来取得了显著进展,但现有方法在涵盖这些方面时仍存在明显差距。本文提出了ReferDINO,一个强大的RVOS模型,它继承了来自基础视觉 grounding 模型的区域级视觉-语言对齐,并进一步赋予像素级密集感知和跨模态时空推理能力。具体而言,ReferDINO集成了两个关键组件:1)一种 grounding-引导的可变形掩码解码器,利用位置预测通过可微分变形机制逐步引导掩码预测;2)一种对象一致时序增强器,将预训练的时变文本特征注入帧间相互作用,以捕获对象感知的动态变化。此外,设计了一种置信度感知的查询修剪策略,在不牺牲模型性能的前提下加速对象解码。在五个基准数据集上的大量实验结果表明,ReferDINO显著优于以往方法(例如在Ref-YouTube-VOS上提升了+3.9%(mathcal{J}&mathcal{F})),且具备实时推理速度(51 FPS)。

关键词

引用

@article{arxiv.2501.14607,
  title  = {ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations},
  author = {Tianming Liang and Kun-Yu Lin and Chaolei Tan and Jianguo Zhang and Wei-Shi Zheng and Jian-Fang Hu},
  journal= {arXiv preprint arXiv:2501.14607},
  year   = {2025}
}

备注

Accepted to ICCV 2025. Project page: \url{https://isee-laboratory.github.io/ReferDINO}