HomE:单应等变的多视角视频表示学习
计算机视觉与模式识别
2023-06-05 v1 人工智能
机器学习
摘要
自监督表示学习的最新进展使得模型在不依赖大量标注数据的情况下实现了更高效和鲁棒的性能。然而,大多数工作仍聚焦于图像,少数关注视频,而关注多视角视频的更少,其中可利用更强大的归纳偏置进行自监督。本文提出一种新颖的多视角视频表示学习方法,显式建模表示空间以保持单应等变性(Homography Equivariance, HomE)。我们的方法学习不同视角间的隐式映射,最终得到一个保持相邻视角间单应关系的表示空间。我们通过动作识别和行人意图预测作为下游任务来评估我们的 HomE 表示。在动作分类上,我们的方法在 UCF101 数据集上取得了 96.4% 的 3-fold 准确率,优于大多数最先进的自监督学习方法。类似地,在 STIP 数据集上,我们在预测未来一秒的行人意图方面以 6% 优于最先进水平,同时取得 91.2% 的行人动作(横穿 vs. 不横穿)分类准确率。代码见 https://github.com/anirudhs123/HomE。
引用
@article{arxiv.2306.01623,
title = {HomE: Homography-Equivariant Video Representation Learning},
author = {Anirudh Sriram and Adrien Gaidon and Jiajun Wu and Juan Carlos Niebles and Li Fei-Fei and Ehsan Adeli},
journal= {arXiv preprint arXiv:2306.01623},
year = {2023}
}
备注
10 pages, 4 figures, 4 tables