DiffPose:用于基于视频的人体姿态估计的时空扩散模型
计算机视觉与模式识别
2023-08-08 v2
摘要
最初为真实图像生成而提出的去噪扩散概率模型近来在各种感知任务(如目标检测与图像分割)中展现出成功,并在计算机视觉中日益受到关注。然而,由于视频中存在额外的时间维度,将此类模型扩展到多帧人体姿态估计并非易事。更重要的是,学习聚焦于关键点区域的特征表示对于人体关节的精确定位至关重要。尽管如此,基于扩散的方法如何达成该目标仍不明确。本文中,我们提出 DiffPose,一种新颖的扩散架构,将基于视频的人体姿态估计表述为条件热力图生成问题。首先,为更好利用时间信息,我们提出时空表示学习器(SpatioTemporal Representation Learner),其跨帧聚合视觉证据并在每个去噪步骤中将所得特征用作条件。此外,我们提出一种称为基于查找的多尺度特征交互(Lookup-based MultiScale Feature Interaction)的机制,以确定局部关节与全局上下文在多尺度上的关联。该机制生成聚焦于关键点区域的精细表示。总体而言,通过扩展扩散模型,我们展示了 DiffPose 在姿态估计任务上的两个独特特性:(i)能够组合多组姿态估计以提升预测精度,尤其针对困难关节;(ii)能够在不重新训练模型的情况下调整用于特征细化的迭代步数。DiffPose 在三个基准上创下新的 SOTA 结果:PoseTrack2017、PoseTrack2018 与 PoseTrack21。
引用
@article{arxiv.2307.16687,
title = {DiffPose: SpatioTemporal Diffusion Model for Video-Based Human Pose Estimation},
author = {Runyang Feng and Yixing Gao and Tze Ho Elden Tse and Xueqing Ma and Hyung Jin Chang},
journal= {arXiv preprint arXiv:2307.16687},
year = {2023}
}
备注
This paper is accepted to ICCV 2023