ReferEverything: 面向视频中一切可指述概念的指代分割
计算机视觉与模式识别
2025-08-08 v2
摘要
我们提出 REM,一个面向视频中可通过自然语言描述的一系列概念的指代分割框架。该方法利用视频扩散模型在互联网规模数据上学到的通用视觉-语言映射,通过在规模较小的指代物体分割数据集上进行微调来实现。我们的核心思想是通过将生成模型的目标从预测噪声转变为预测掩码潜变量,从而保留生成模型的完整架构。由此产生的模型能够准确分割罕见和未见过的物体,尽管仅训练于有限的类别集合。此外,它可以轻松泛化到非物体的动态概念,如烟雾或雨滴,这在我们新的指代视频过程分割(Ref-VPS)基准测试中得到了验证。REM 在 Ref-DAVIS 等领域内数据集上的表现与最先进方法持平,同时借助生成式预训练的力量,在领域外数据上最多超出 12 个 IoU。我们还表明,视频生成技术的进步直接提升了分割性能。
引用
@article{arxiv.2410.23287,
title = {ReferEverything: Towards Segmenting Everything We Can Speak of in Videos},
author = {Anurag Bagchi and Zhipeng Bao and Yu-Xiong Wang and Pavel Tokmakov and Martial Hebert},
journal= {arXiv preprint arXiv:2410.23287},
year = {2025}
}
备注
Project page at https://refereverything.github.io/