视频自监督学习:综述
计算机视觉与模式识别
2023-07-20 v3 多媒体
摘要
深度学习在各领域的显著成功依赖于大规模标注数据集的可用性。然而,获取标注代价高昂且需极大精力,对视频而言尤为困难。此外,使用人工生成标注会导致模型产生偏置学习以及较差的域泛化与鲁棒性。作为替代,自监督学习提供了一种无需标注的表示学习方式,并已在图像与视频领域展现出潜力。不同于图像域,学习视频表示因时间维度引入运动与其他环境动态而更具挑战。这也带来了推进视频与多模态域自监督学习的视频专属思路机遇。本综述中,我们回顾聚焦于视频域的现有自监督学习方法。基于学习目标将这些方法归纳为四类:1) pretext任务,2) 生成式学习,3) 对比学习,4) 跨模态一致性。我们进一步介绍了常用数据集、下游评估任务、对现有工作局限的见解,以及该领域的潜在未来方向。
引用
@article{arxiv.2207.00419,
title = {Self-Supervised Learning for Videos: A Survey},
author = {Madeline C. Schiappa and Yogesh S. Rawat and Mubarak Shah},
journal= {arXiv preprint arXiv:2207.00419},
year = {2023}
}
备注
ACM CSUR (December 2022). Project Link: https://bit.ly/3Oimc7Q