中文

学习运动与时序线索的无监督视频目标分割

计算机视觉与模式识别 2025-01-15 v1

摘要

在本文中,我们通过提出一种名为 MTNet 的高效算法来解决无监督视频目标分割(UVOS)中的挑战,该算法同时利用运动和时序线索。以往的方法仅侧重于将外观与运动相结合或对时序关系进行建模,与此不同,我们的方法将这两个方面整合在统一框架中。MTNet 通过在编码器的特征提取过程中有效地融合外观和运动特征而设计,促进了更具互补性的表示。为了捕捉视频中嵌入的复杂长程上下文动态与信息,引入了时序 Transformer 模块,促进了整个视频片段中有效的帧间交互。此外,我们在所有特征层级上采用级联解码器以最优地利用所提取的特征,旨在生成日益精确的分割掩码。因此,MTNet 提供了一个强大且紧凑的框架,探索时序和跨模态知识,以在各种挑战性场景中高效地稳健定位和准确跟踪主要目标。在多个基准上的大量实验确凿地表明,我们的方法不仅在无监督视频目标分割中取得了 SOTA 性能,而且在视频显著目标检测中提供了有竞争力的结果。这些发现突出了该方法的稳健多功能性及其在适应一系列分割任务方面的熟练度。源代码可在 https://github.com/hy0523/MTNet 获取。

关键词

引用

@article{arxiv.2501.07806,
  title  = {Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation},
  author = {Yunzhi Zhuge and Hongyu Gu and Lu Zhang and Jinqing Qi and Huchuan Lu},
  journal= {arXiv preprint arXiv:2501.07806},
  year   = {2025}
}

备注

Accepted to IEEE Transactions on Neural Networks and Learning Systems (TNNLS)