中文

VideoSAM:开放世界视频分割

计算机视觉与模式识别 2024-10-14 v1

摘要

视频分割对于推进机器人和自动驾驶尤为重要,尤其是在开放世界环境中,连续的感知和跨视频帧的对象关联至关重要。虽然Segment Anything Model(SAM)在静态图像分割方面表现出色,但将其能力扩展到视频分割面临重大挑战。我们解决了两个主要难题:a) SAM在关联跨帧对象的嵌入存在局限性;b) 对象分割的细粒度不一致。为此,我们引入VideoSAM,一个旨在改善动态环境中对象跟踪和分割一致性的端到端框架。VideoSAM集成了聚合式主干网络RADIO,实现通过相似性度量进行对象关联,并引入Cycle-ack-Pairs Propagation搭配记忆机制实现稳定的对象跟踪。此外,我们在SAM解码器中引入自回归对象标记机制,以维持跨帧的一致细粒度。我们在UVO和BURST基准测试中对该方法进行了广泛评估,并在来自RoboTAP的机器人视频中表现出色,展示了其在真实场景中的有效性和鲁棒性。所有代码将公开 availability。

关键词

引用

@article{arxiv.2410.08781,
  title  = {VideoSAM: Open-World Video Segmentation},
  author = {Pinxue Guo and Zixu Zhao and Jianxiong Gao and Chongruo Wu and Tong He and Zheng Zhang and Tianjun Xiao and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2410.08781},
  year   = {2024}
}