3D-CSL:用于近重复视频检索的自监督 3D 上下文相似性学习
计算机视觉与模式识别
2022-11-11 v1
摘要
在本文中,我们介绍了 3D-CSL,一种用于近重复视频检索(NDVR)的紧凑流水线,并探索了一种用于视频相似性学习的新型自监督学习策略。以往的大多数方法仅从帧中分别提取视频空间特征,然后设计各种复杂机制来学习帧特征之间的时间相关性。然而,部分时空依赖已经丢失。为了解决这个问题,我们的 3D-CSL 使用 3D transformer 端到端地提取视频中的全局时空依赖,并通过在片段级别上进行匹配在效率和有效性之间找到了良好的平衡。此外,我们提出了一种两阶段自监督相似性学习策略来优化整个网络。首先,我们提出 PredMAE 以视频预测任务预训练 3D transformer;其次,提出了新型视频特定增强 ShotMix 和新型三元组损失 FCS loss 以进一步提升相似性学习结果。在 FIVR-200K 和 CC_WEB_VIDEO 上的实验证明了我们方法的优越性和可靠性,该方法在片段级 NDVR 上实现了 SOTA 性能。
引用
@article{arxiv.2211.05352,
title = {3D-CSL: self-supervised 3D context similarity learning for Near-Duplicate Video Retrieval},
author = {Rui Deng and Qian Wu and Yuke Li},
journal= {arXiv preprint arXiv:2211.05352},
year = {2022}
}