视频中人体姿态估计的流动卷积网络
计算机视觉与模式识别
2015-11-10 v2
摘要
这项工作的目标是在有多帧可用的视频中进行人体姿态估计。我们研究了一种卷积网络(ConvNet)架构,能够通过使用光流跨多帧组合信息来从时间上下文中获益。为此,我们提出了一种具有以下新颖之处的网络架构:(i) 比先前用于回归热图所研究的更深的网络;(ii) 学习隐式空间模型的空间融合层;(iii) 使用光流对齐来自相邻帧的热图预测;以及 (iv) 一个最终参数化池化层,其学习将对齐的热图组合成池化置信图。我们表明该架构优于许多其他架构,包括仅在输入层使用光流的架构、直接回归关节坐标的架构,以及预测热图而无空间融合的架构。新架构在三个视频姿态估计数据集上大幅优于 state of the art 方法,包括极具挑战性的 Poses in the Wild 数据集,并且在单图像 FLIC 基准上优于其他不使用图模型的深度方法(以及在高精度区域优于 Chen & Yuille 和 Tompson 等人)。
引用
@article{arxiv.1506.02897,
title = {Flowing ConvNets for Human Pose Estimation in Videos},
author = {Tomas Pfister and James Charles and Andrew Zisserman},
journal= {arXiv preprint arXiv:1506.02897},
year = {2015}
}
备注
ICCV'15