中文

Tsanet:面向无监督视频目标分割的时间与尺度对齐

计算机视觉与模式识别 2024-02-22 v2

摘要

无监督视频目标分割(UVOS)指在无人工引导下分割视频中显著目标的艰巨任务。近期工作中,UVOS的两种方法可被划分为:基于外观的方法与基于外观-运动的方法,它们分别存在局限。基于外观的方法因利用随机配对帧间的相关性信息而未考虑目标对象的运动。基于外观-运动的方法由于将外观与运动融合,存在对光流依赖占主导的局限。本文提出一种新颖的UVOS框架,可从时间与尺度两方面解决上述两类方法的局限。时间对齐融合将相邻帧的显著性信息与目标帧对齐,以利用相邻帧的信息。尺度对齐解码器通过隐式神经表示的连续映射聚合多尺度特征图来预测目标对象掩码。我们在公开基准数据集DAVIS 2016与FBMS上给出实验结果,证明了方法的有效性。此外,我们在DAVIS 2016上优于当前最优(SOTA)方法。

关键词

引用

@article{arxiv.2303.04376,
  title  = {Tsanet: Temporal and Scale Alignment for Unsupervised Video Object Segmentation},
  author = {Seunghoon Lee and Suhwan Cho and Dogyoon Lee and Minhyeok Lee and Sangyoun Lee},
  journal= {arXiv preprint arXiv:2303.04376},
  year   = {2024}
}

备注

Accepted to ICIP 2023