从稀疏标注视频中学习时序姿态估计
计算机视觉与模式识别
2019-12-12 v3
摘要
现代视频中多人姿态估计方法需要大量密集标注。然而,标注视频中的每一帧成本高且劳动密集。为减少对密集标注的需求,我们提出PoseWarper网络,利用具有稀疏标注(每k帧)的训练视频来学习执行密集时序姿态传播与估计。给定一对视频帧——标注帧A与未标注帧B——我们训练模型通过使用来自帧B的特征并以可变形卷积隐式学习A与B之间的姿态扭曲,从而预测帧A中的人体姿态。我们展示了可将训练好的PoseWarper用于若干应用。首先,在推理时我们可以反转网络的应用方向,以将姿态信息从手动标注帧传播到未标注帧。这使得仅给定少量手动标注帧即可为整个视频生成姿态标注成为可能。与基于光流的现代标签传播方法相比,我们的扭曲机制更加紧凑(6M对比39M参数),且更准确(88.7% mAP对比83.8% mAP)。我们还表明,通过在获得的传播姿态添加到原始手动标签的增广数据集上训练姿态估计器,可提升其精度。最后,我们可以在推理时使用PoseWarper聚合来自邻帧的时序姿态信息。这使我们的系统在PoseTrack2017与PoseTrack2018数据集上取得最先进的姿态检测结果。代码已发布于:https://github.com/facebookresearch/PoseWarper。
引用
@article{arxiv.1906.04016,
title = {Learning Temporal Pose Estimation from Sparsely-Labeled Videos},
author = {Gedas Bertasius and Christoph Feichtenhofer and Du Tran and Jianbo Shi and Lorenzo Torresani},
journal= {arXiv preprint arXiv:1906.04016},
year = {2019}
}
备注
Accepted to NeurIPS 2019