DeciWatch:一种实现10倍效率提升的2D与3D姿态估计简单基线
计算机视觉与模式识别
2022-07-22 v2
摘要
本文提出一种基于视频的2D/3D人体姿态估计简单基线框架,名为DeciWatch,其可在无任何性能下降的情况下,相较现有工作实现10倍效率提升。不同于当前对视频中每一帧进行估计的方案,DeciWatch引入了一种简单而有效的采样-去噪-恢复框架,仅对稀疏采样的帧进行观测,利用人体运动的连续性与轻量级姿态表示。具体而言,DeciWatch均匀采样少于10%的视频帧进行精细估计,利用高效的Transformer架构对估计的2D/3D姿态去噪,随后使用另一个基于Transformer的网络准确恢复其余帧。在三个基于视频的人体姿态估计与身体网格恢复任务、四个数据集上的综合实验结果验证了DeciWatch的效率与有效性。代码见https://github.com/cure-lab/DeciWatch。
引用
@article{arxiv.2203.08713,
title = {DeciWatch: A Simple Baseline for 10x Efficient 2D and 3D Pose Estimation},
author = {Ailing Zeng and Xuan Ju and Lei Yang and Ruiyuan Gao and Xizhou Zhu and Bo Dai and Qiang Xu},
journal= {arXiv preprint arXiv:2203.08713},
year = {2022}
}
备注
Accepted by ECCV 2022