PSVT:基于渐进式视频Transformer的端到端多人三维姿态与形状估计
计算机视觉与模式识别
2023-03-17 v1
摘要
现有的多人视频三维人体姿态与形状估计(PSE)方法通常采用两阶段策略,即先检测每帧中的人体实例,再用时序模型进行单人PSE。然而,空间实例间的全局时空上下文无法被捕获。本文提出一种基于渐进式视频Transformer的端到端多人三维姿态与形状估计框架,称为PSVT。在PSVT中,时空编码器(STE)捕获空间对象间的全局特征依赖。随后,时空姿态解码器(STPD)和形状解码器(STSD)分别捕获姿态查询与特征令牌、形状查询与特征令牌之间的全局依赖。为处理随时间推移的对象变化,采用一种新颖的渐进式解码方案来更新每帧的姿态和形状查询。此外,我们提出一种新颖的姿态引导注意力(PGA)用于形状解码器,以更好地预测形状参数。这两个组件增强了PSVT的解码器从而提升性能。在四个数据集上的大量实验表明,PSVT取得了当前最佳(SOTA)结果。
引用
@article{arxiv.2303.09187,
title = {PSVT: End-to-End Multi-person 3D Pose and Shape Estimation with Progressive Video Transformers},
author = {Zhongwei Qiu and Yang Qiansheng and Jian Wang and Haocheng Feng and Junyu Han and Errui Ding and Chang Xu and Dongmei Fu and Jingdong Wang},
journal= {arXiv preprint arXiv:2303.09187},
year = {2023}
}
备注
CVPR2023