中文

基于对比视频表示学习的长短期视图特征分解

计算机视觉与模式识别 2021-09-27 v1

摘要

自监督视频表示学习方法通常聚焦于视频中时间属性的表示。然而,平稳与非平稳属性的作用较少被探索:平稳特征在整个视频中保持相似,可用于预测视频级动作类别;非平稳特征表示随时间变化的属性,更利于涉及更细粒度时间理解的下游任务,如动作分割。我们认为用单一表示捕捉两类特征是非最优的,并提出通过来自长视图与短视图(即长视频序列及其较短子序列)的对比学习,将表示空间分解为平稳与非平稳特征。平稳特征在短视图与长视图间共享,而非平稳特征聚合短视图以匹配相应长视图。为实证验证我们的方法,我们展示了平稳特征在动作识别下游任务上表现尤为良好,而非平稳特征在动作分割上表现更优。此外,我们分析了所学表示,发现平稳特征捕捉更具时间稳定性的静态属性,而非平稳特征涵盖更多随时间变化的属性。

关键词

引用

@article{arxiv.2109.11593,
  title  = {Long Short View Feature Decomposition via Contrastive Video Representation Learning},
  author = {Nadine Behrmann and Mohsen Fayyaz and Juergen Gall and Mehdi Noroozi},
  journal= {arXiv preprint arXiv:2109.11593},
  year   = {2021}
}

备注

ICCV 2021 (Main Conference)