中文

直接多视角多人三维姿态估计

计算机视觉与模式识别 2021-11-30 v2

摘要

我们提出多视角姿态变换器(MvP)用于从多视角图像估计多人三维姿态。与以往通过代价高昂的体素表示估计三维关节位置或从多个检测到的二维姿态重建每人三维姿态的方法不同,MvP以简洁高效的方式直接回归多人三维姿态,不依赖中间任务。具体而言,MvP将骨架关节表示为可学习的查询嵌入,并让它们逐步关注并推理来自输入图像的多视角信息,以直接回归实际的三维关节位置。为提高这一简洁流程的精度,MvP提出了一种层次化方案来简洁表示多人骨架关节的查询嵌入,并引入了输入依赖的查询自适应方法。此外,MvP设计了一种称为投影注意力的新型几何引导注意力机制,以更精确地融合各关节的跨视角信息。MvP还引入了RayConv操作,将视角相关的相机几何整合进特征表示以增强投影注意力。我们通过实验表明,我们的MvP模型在多个基准上优于最先进方法,同时效率更高。值得注意的是,它在具挑战性的Panoptic数据集上达到92.3% AP25,比先前最佳方法[36]提升9.8%。MvP具有通用性且可扩展至恢复由SMPL模型表示的人体网格,从而有助于建模多人身体形状。代码与模型见 https://github.com/sail-sg/mvp。

关键词

引用

@article{arxiv.2111.04076,
  title  = {Direct Multi-view Multi-person 3D Pose Estimation},
  author = {Tao Wang and Jianfeng Zhang and Yujun Cai and Shuicheng Yan and Jiashi Feng},
  journal= {arXiv preprint arXiv:2111.04076},
  year   = {2021}
}

备注

NeurIPS-2021