HandDiff:基于图像-点云扩散的三维手部姿态估计
计算机视觉与模式识别
2024-04-05 v1
摘要
从输入手部帧中提取关键点位置(即三维手部姿态估计)是各种人机交互应用中的一项关键任务。本质上,三维手部姿态估计可以被视为以输入帧为条件的三维点集子集生成问题。得益于近期基于扩散的生成模型的显著进展,手部姿态估计也可以受益于扩散模型,以高质量地估计关键点位置。然而,直接部署现有的扩散模型来解决手部姿态估计并非易事,因为它们无法实现复杂的置换映射和精确定位。基于此动机,本文提出了 HandDiff,一种基于扩散的手部姿态估计模型,该模型以手形图像-点云为条件,迭代地去除噪声以获得准确的手部姿态。为了恢复关键点置换和准确位置,我们进一步引入了逐关节条件和局部细节条件。实验结果表明,所提出的 HandDiff 在四个具有挑战性的手部姿态基准数据集上显著优于现有方法。代码和预训练模型已在 https://github.com/cwc1260/HandDiff 公开。
引用
@article{arxiv.2404.03159,
title = {HandDiff: 3D Hand Pose Estimation with Diffusion on Image-Point Cloud},
author = {Wencan Cheng and Hao Tang and Luc Van Gool and Jong Hwan Ko},
journal= {arXiv preprint arXiv:2404.03159},
year = {2024}
}
备注
Accepted as a conference paper to the Conference on Computer Vision and Pattern Recognition (2024)