从对应提议中学习视频表示
计算机视觉与模式识别
2019-05-21 v1 机器学习
摘要
帧间的对应关系编码了视频中动态内容的丰富信息。然而,由于其不规则结构和复杂动态,有效捕获和学习这些信息具有挑战性。本文提出一种新颖的神经网络,通过聚合潜在对应关系中的信息来学习视频表示。该网络名为 ,能够学习具有时间一致性的演化二维场。特别地,它可以通过混合外观与长程运动并以仅 RGB 输入有效地学习视频表示。我们提供了大量消融实验来验证我们的模型。CPNet 在 Kinetics 上表现出比现有方法更强的性能,并在 Something-Something 和 Jester 上取得了最先进的性能。我们对模型的行为进行了分析,并展示了其对提议中错误的鲁棒性。
引用
@article{arxiv.1905.07853,
title = {Learning Video Representations from Correspondence Proposals},
author = {Xingyu Liu and Joon-Young Lee and Hailin Jin},
journal= {arXiv preprint arXiv:1905.07853},
year = {2019}
}
备注
CVPR 2019 (Oral)