中文

通过时空插值一致性训练的视频阴影检测

计算机视觉与模式识别 2022-06-20 v1

摘要

为监督式视频阴影检测方法标注大规模数据集具有挑战性。将标注图像上训练的模型直接用于视频帧可能导致高泛化误差与 temporal 不一致的结果。本文中,我们通过提出时空插值一致性训练(STICT)框架来解决这些挑战,该框架合理地将无标注视频帧与标注图像一同送入图像阴影检测网络训练。具体而言,我们提出空间与时间 ICT,其中定义了两种新插值方案,即空间插值与时间插值。我们相应导出空间与时间插值一致性约束,分别用于增强像素级分类任务中的泛化能力,以及鼓励 temporal 一致预测。此外,我们设计了一个尺度感知网络用于图像中的多尺度阴影知识学习,并提出尺度一致性约束以最小化不同尺度预测间的差异。我们提出的方法在 ViSha 数据集与一自标注数据集上进行了广泛验证。实验结果表明,即便无视频标签,我们的方法也优于大多数 SOTA 的监督、半监督或无监督图像/视频阴影检测方法及相关任务中的其他方法。代码与数据集见 \url{https://github.com/yihong-97/STICT}。

关键词

引用

@article{arxiv.2206.08801,
  title  = {Video Shadow Detection via Spatio-Temporal Interpolation Consistency Training},
  author = {Xiao Lu and Yihong Cao and Sheng Liu and Chengjiang Long and Zipei Chen and Xuanyu Zhou and Yimin Yang and Chunxia Xiao},
  journal= {arXiv preprint arXiv:2206.08801},
  year   = {2022}
}

备注

Accepted in CVPR2022