面向零样本视频对象分割的深度感知测试时训练
计算机视觉与模式识别
2024-03-08 v1
摘要
零样本视频对象分割(ZSVOS)旨在无需任何人工标注的情况下分割主要运动物体。主流解决方案主要专注于在大规模视频数据集上学习单一模型,难以泛化至未见过的视频。本文引入一种测试时训练(TTT)策略来解决该问题。我们的核心洞察是在 TTT 过程中强制模型预测一致的深度。具体而言,我们首先训练一个单一网络以同时执行分割和深度预测任务,这可以通过我们专门设计的深度调制层有效地学习。随后,在 TTT 过程中,通过对同一帧在不同数据增强下预测一致的深度图来更新模型。此外,我们探索了不同的 TTT 权重更新策略。实证结果表明,基于动量的权重初始化和基于循环的训练方案能带来更稳定的提升。实验显示,所提方法在 ZSVOS 上取得了显著改进。我们提出的视频 TTT 策略相较于最先进的 TTT 方法具有显著优势。代码地址:https://nifangbaage.github.io/DATTT。
引用
@article{arxiv.2403.04258,
title = {Depth-aware Test-Time Training for Zero-shot Video Object Segmentation},
author = {Weihuang Liu and Xi Shen and Haolun Li and Xiuli Bi and Bo Liu and Chi-Man Pun and Xiaodong Cun},
journal= {arXiv preprint arXiv:2403.04258},
year = {2024}
}
备注
Accepted by CVPR 2024