中文

面向零样本视频对象分割的深度感知测试时训练

计算机视觉与模式识别 2024-03-08 v1

摘要

零样本视频对象分割(ZSVOS)旨在无需任何人工标注的情况下分割主要运动物体。主流解决方案主要专注于在大规模视频数据集上学习单一模型,难以泛化至未见过的视频。本文引入一种测试时训练(TTT)策略来解决该问题。我们的核心洞察是在 TTT 过程中强制模型预测一致的深度。具体而言,我们首先训练一个单一网络以同时执行分割和深度预测任务,这可以通过我们专门设计的深度调制层有效地学习。随后,在 TTT 过程中,通过对同一帧在不同数据增强下预测一致的深度图来更新模型。此外,我们探索了不同的 TTT 权重更新策略。实证结果表明,基于动量的权重初始化和基于循环的训练方案能带来更稳定的提升。实验显示,所提方法在 ZSVOS 上取得了显著改进。我们提出的视频 TTT 策略相较于最先进的 TTT 方法具有显著优势。代码地址:https://nifangbaage.github.io/DATTT。

关键词

引用

@article{arxiv.2403.04258,
  title  = {Depth-aware Test-Time Training for Zero-shot Video Object Segmentation},
  author = {Weihuang Liu and Xi Shen and Haolun Li and Xiuli Bi and Bo Liu and Chi-Man Pun and Xiaodong Cun},
  journal= {arXiv preprint arXiv:2403.04258},
  year   = {2024}
}

备注

Accepted by CVPR 2024