三重协同视频阴影检测
计算机视觉与模式识别
2021-03-12 v1
摘要
单幅图像中的阴影检测近年来受到显著研究关注。然而,针对动态场景的阴影检测探索甚少。瓶颈在于缺乏带有高质量标注的、用于视频阴影检测的成熟数据集。在本工作中,我们收集了一个新的视频阴影检测数据集,包含 120 段视频、11,685 帧,覆盖 60 个对象类别、不同长度以及不同运动/光照条件。所有帧均标注了高质量的像素级阴影掩码。据我们所知,这是首个面向学习的视频阴影检测数据集。此外,我们提出了一种名为三重协同视频阴影检测网络(TVSD-Net)的新基线模型。它以协同方式利用三个并行网络,在视频内和视频间层面学习判别性表示。在网络内部,提出了一个双门控共注意力模块以约束同一视频中相邻帧的特征,同时引入辅助相似性损失以挖掘不同视频间的语义信息。最后,我们在 ViSha 上进行了综合研究,评估了 12 个 SOTA 模型(包括单图像阴影检测器、视频对象分割和显著性检测方法)。实验表明我们的模型优于 SOTA 竞争者。
引用
@article{arxiv.2103.06533,
title = {Triple-cooperative Video Shadow Detection},
author = {Zhihao Chen and Liang Wan and Lei Zhu and Jia Shen and Huazhu Fu and Wennan Liu and Jing Qin},
journal= {arXiv preprint arXiv:2103.06533},
year = {2021}
}