SmoothNet:一个即插即用的人体姿态视频细化网络
计算机视觉与模式识别
2022-07-22 v2
摘要
在分析人体运动视频时,现有姿态估计器的输出抖动极不平衡,各帧估计误差差异显著。视频中多数帧相对容易估计,仅存在轻微抖动。相反,对于罕见或遮挡动作,连续多帧中多个关节的估计位置严重偏离真值,导致显著抖动。为解决此问题,我们提出在现有姿态估计器上附加一个专用的纯时间细化网络以缓解抖动,名为 SmoothNet。不同于现有基于学习的方案采用时空模型在所有关节上协同优化逐帧精度与时间平滑性,SmoothNet 通过学习每个关节的长程时间关系来建模身体运动的自然平滑特性,而不考虑关节间含噪关联。借助简单而有效的运动感知全连接网络,SmoothNet 显著改善了现有姿态估计器的时间平滑性,并作为副作用提升了那些困难帧的估计精度。此外,作为纯时间模型,SmoothNet 的独特优势在于其对各类估计器与数据集的强可迁移性。在五个数据集上、基于十一种流行骨干网络、跨越 2D 与 3D 姿态估计及身体恢复任务的全面实验证明了所提方案的有效性。代码见 https://github.com/cure-lab/SmoothNet。
引用
@article{arxiv.2112.13715,
title = {SmoothNet: A Plug-and-Play Network for Refining Human Poses in Videos},
author = {Ailing Zeng and Lei Yang and Xuan Ju and Jiefeng Li and Jianyi Wang and Qiang Xu},
journal= {arXiv preprint arXiv:2112.13715},
year = {2022}
}
备注
Accepted by ECCV 2022