单张带上下文的 2D 姿态胜过多帧用于 3D 人体姿态估计
计算机视觉与模式识别
2023-11-10 v2
摘要
将 2D 姿态序列提升为 3D 的 3D 人体姿态估计主导范式严重依赖长期时间线索(即使用大量视频帧)以提高精度,这导致性能饱和、难以处理的计算和非因果问题。这可归因于它们固有的无法感知空间上下文,因为普通 2D 关节坐标不携带视觉线索。为解决这个问题,我们提出一个直接而有力的方案:利用现成(预训练)2D 姿态检测器产生的易于获得的中间视觉表示——甚至无需在 3D 任务上微调。关键观察是,当姿态检测器学习定位 2D 关节时,由于骨干网络中的区域操作,此类表示(例如特征图)隐式编码了以关节为中心的空间上下文。我们设计了一个名为 Context-Aware PoseFormer 的简单基线来展示其有效性。在无法访问任何时间信息的情况下,所提方法在速度和精度上均显著优于其无上下文对应的 PoseFormer,以及其他使用多达数百视频帧的最先进方法。项目页面:https://qitaozhao.github.io/ContextAware-PoseFormer
引用
@article{arxiv.2311.03312,
title = {A Single 2D Pose with Context is Worth Hundreds for 3D Human Pose Estimation},
author = {Qitao Zhao and Ce Zheng and Mengyuan Liu and Chen Chen},
journal= {arXiv preprint arXiv:2311.03312},
year = {2023}
}
备注
Accepted to NeurIPS 2023