IVT:一种用于三维姿态估计的端到端实例引导视频 Transformer
计算机视觉与模式识别
2022-08-09 v1 人工智能
摘要
视频三维人体姿态估计旨在从视频中定位人体关节的三维坐标。近期基于 Transformer 的方法侧重于从时序二维姿态中捕获时空信息,由于视觉深度特征在二维姿态估计步骤中丢失,无法有效建模上下文深度特征。本文将该范式简化为一个端到端框架——实例引导视频 Transformer(IVT),其能从视觉特征中有效学习时空上下文深度信息,并直接从视频帧预测三维姿态。具体而言,我们首先将视频帧表示为一系列实例引导令牌(token),每个令牌负责预测一个人体实例的三维姿态。这些令牌包含身体结构信息,因为它们是由从人体中心到相应身体关节的关节偏移引导提取的。随后,这些令牌被送入 IVT 以学习时空上下文深度。此外,我们提出一种跨尺度实例引导注意力机制来处理多人之间变化的尺度。最后,每个人的三维姿态通过坐标回归从实例引导令牌中解码。在三个广泛使用的三维姿态估计基准上的实验表明,所提 IVT 取得了最先进的性能。
引用
@article{arxiv.2208.03431,
title = {IVT: An End-to-End Instance-guided Video Transformer for 3D Pose Estimation},
author = {Zhongwei Qiu and Qiansheng Yang and Jian Wang and Dongmei Fu},
journal= {arXiv preprint arXiv:2208.03431},
year = {2022}
}
备注
ACM Multimedia 2022, oral