中文

视频运动分量分割:一种长期无监督模型

计算机视觉与模式识别 2024-04-18 v3

摘要

人类具备持续分析视频并即时提取运动分量的能力。我们期望采用这一范式,为视频序列提供连贯且稳定的运动分割。为此,我们提出了一种以完全无监督方式运行的新型长期时空模型。它以连续光流(OF)场的体积作为输入,输出覆盖视频的连贯运动分割体积。更具体地,我们设计了一个基于Transformer的网络,利用一个数学上严谨的框架——证据下界(ELBO)来推导损失函数。该损失函数结合了流重建项(涉及时空参数化运动模型,以新颖方式组合了用于空间维度的多项式(二次)运动模型与用于视频序列时间维度的B样条)以及强制分割时间一致性的正则化项。我们在四个VOS基准上报告了实验,展示了具有竞争力的定量结果,同时一次性对整个序列进行运动分割。我们还通过可视化结果凸显了本方法在时间一致性方面的关键贡献。

关键词

引用

@article{arxiv.2310.01040,
  title  = {Segmenting the motion components of a video: A long-term unsupervised model},
  author = {Etienne Meunier and Patrick Bouthemy},
  journal= {arXiv preprint arXiv:2310.01040},
  year   = {2024}
}