中文

基于泰勒展开的视频动力学展开

计算机视觉与模式识别 2024-09-10 v2

摘要

我们受物理运动的启发,提出了一种新的自监督视频动力学学习策略:Video Time-Differentiation for Instance Discrimination (ViDiDi)。ViDiDi 是一种简单且数据高效的策略,可 readily 应用于基于 instance discrimination 的现有自监督视频表示学习框架。其核心是通过帧序列的各种时间导数来观察视频的不同方面。这些导数以及原始帧支持对离散时间下 underlying 连续动力学的泰勒级数展开,其中更高阶的导数强调更高阶的运动特征。ViDiDi 学习一个单一的神经网络,将视频及其时间导数编码为 consistent embeddings,遵循平衡的交替学习算法。通过学习原始帧和导数的 consistent representations,编码器被引导强化静态背景上的运动特征,并揭示原始帧中隐藏的动力学。因此,视频表示更好地被动态特征分离。我们将 ViDiDi 集成到现有的 instance discrimination 框架 (VICReg、BYOL 和 SimCLR) 中,用于 UCF101 或 Kinetics 进行预训练,并在包括视频检索、动作识别和动作检测在内的标准基准测试上进行测试。结果在不需大型模型或大量数据集的情况下显著提升。

关键词

引用

@article{arxiv.2409.02371,
  title  = {Unfolding Videos Dynamics via Taylor Expansion},
  author = {Siyi Chen and Minkyu Choi and Zesen Zhao and Kuan Han and Qing Qu and Zhongming Liu},
  journal= {arXiv preprint arXiv:2409.02371},
  year   = {2024}
}