Snipper:一种用于视频片段上多人三维姿态估计、跟踪与预测同时完成的时空 Transformer
计算机视觉与模式识别
2023-09-14 v3
摘要
从 RGB 视频理解多人姿态涉及三个复杂任务:姿态估计、跟踪与运动预测。直观上,准确的多人姿态估计有助于稳健跟踪,而稳健跟踪为正确运动预测构建关键历史。大多数现有工作要么聚焦于单一任务,要么采用多阶段方法分别解决多个任务,这往往使各阶段做出次优决策且无法利用三个任务间的关联。在本文中,我们提出 Snipper,一个统一框架,以单阶段同时执行多人三维姿态估计、跟踪与运动预测。我们提出一种高效而强大的可变形注意力机制来聚合视频片段的时空信息。基于该可变形注意力,学习一个视频 transformer 以编码来自多帧片段的时空特征,并为多人姿态查询解码出信息丰富的姿态特征。最后,这些姿态查询被回归以一次性预测多人姿态轨迹与未来运动。在实验中,我们在三个具挑战性的公开数据集上展示了 Snipper 的有效性,其中我们的通用模型可与用于姿态估计、跟踪和预测的专业最先进(state-of-art)基线相媲美。
引用
@article{arxiv.2207.04320,
title = {Snipper: A Spatiotemporal Transformer for Simultaneous Multi-Person 3D Pose Estimation Tracking and Forecasting on a Video Snippet},
author = {Shihao Zou and Yuanlu Xu and Chao Li and Lingni Ma and Li Cheng and Minh Vo},
journal= {arXiv preprint arXiv:2207.04320},
year = {2023}
}