HHMR:通过增强图扩散模型的多模态可控性实现整体手部网格恢复
计算机视觉与模式识别
2024-06-04 v1
摘要
近年来,生成与重建范式的深度融合已成为一种趋势。在本文中,我们扩展了可控生成模型的能力,以完成更全面的手部网格恢复任务:在单一框架内直接进行手部网格生成、修复、重建和拟合,我们将其命名为整体手部网格恢复(HHMR)。我们的关键观察是,不同类型的手部网格恢复任务可以通过一个具有强大多模态可控性的单一生成模型来实现,并且在此类框架中,实现不同任务仅需给出不同的信号作为条件。为了实现这一目标,我们提出了一种基于图卷积和注意力机制的全能扩散框架,用于整体手部网格恢复。为了在确保多模态控制信号解耦的同时实现强大的控制生成能力,我们将不同模态映射到共享特征空间,并在模态和特征层面应用跨尺度随机掩码。通过这种方式,在手部先验学习过程中可以充分利用不同模态之间的相关性。此外,我们提出了条件对齐梯度引导(Condition-aligned Gradient Guidance)来增强生成模型与控制信号的对齐,这显著提高了手部网格重建和拟合的精度。实验表明,我们的新颖框架可以同时实现多种手部网格恢复任务,并在不同任务上优于现有方法,这为后续的下游应用(包括手势识别、姿态生成、网格编辑等)提供了更多可能性。
引用
@article{arxiv.2406.01334,
title = {HHMR: Holistic Hand Mesh Recovery by Enhancing the Multimodal Controllability of Graph Diffusion Models},
author = {Mengcheng Li and Hongwen Zhang and Yuxiang Zhang and Ruizhi Shao and Tao Yu and Yebin Liu},
journal= {arXiv preprint arXiv:2406.01334},
year = {2024}
}
备注
accepted in CVPR2024, project page: https://dw1010.github.io/project/HHMR/HHMR.html