中文

面向对比视频表征学习的细粒度时空运动对齐

计算机视觉与模式识别 2024-10-16 v2

摘要

作为视频中最本质的属性,运动信息对于鲁棒且泛化的视频表征至关重要。为注入运动动态,近期工作在视频对比学习中采用帧差作为运动信息来源,以权衡质量与代价。然而,现有工作在实例层面对齐运动特征,存在跨模态的时空弱对齐问题。本文提出一种细粒度运动对齐(FiMA,Fine-grained Motion Alignment)框架,能够引入对齐良好且显著的运动信息。具体而言,我们首先在时空域构建稠密对比学习框架,以生成像素级运动监督。随后,设计运动解码器与前景采样策略,以消除时间与空间上的弱对齐。此外,提出帧级运动对比损失以提升运动特征的时间多样性。大量实验表明,FiMA学到的表征具备出色的运动感知能力,并在UCF101、HMDB51和Diving48数据集的下游任务上取得最先进或具竞争力的结果。代码见 \url{https://github.com/ZMHH-H/FIMA}。

关键词

引用

@article{arxiv.2309.00297,
  title  = {Fine-Grained Spatiotemporal Motion Alignment for Contrastive Video Representation Learning},
  author = {Minghao Zhu and Xiao Lin and Ronghao Dang and Chengju Liu and Qijun Chen},
  journal= {arXiv preprint arXiv:2309.00297},
  year   = {2024}
}

备注

ACM MM 2023 Camera Ready