从未见视点识别视频中的动作
计算机视觉与模式识别
2021-03-31 v1
摘要
视频识别的标准方法使用旨在捕获时空数据的大型 CNN。然而,训练这些模型需要大量带标签的训练数据,包含多种多样的动作、场景、设置和相机视点。在本文中,我们表明当前的卷积神经网络模型无法识别其训练数据中未出现的相机视点下的动作(即未见视点动作识别)。为此,我们开发了基于 3D 表示的方法,并引入了一种新的几何卷积层,能够学习视点不变表示。此外,我们引入了一个新的、具有挑战性的未见视点识别数据集,并展示了该方法学习视点不变表示的能力。
引用
@article{arxiv.2103.16516,
title = {Recognizing Actions in Videos from Unseen Viewpoints},
author = {AJ Piergiovanni and Michael S. Ryoo},
journal= {arXiv preprint arXiv:2103.16516},
year = {2021}
}