HanDrawer:利用空间信息在单阶段中通过条件扩散模型渲染逼真手部
计算机视觉与模式识别
2025-03-05 v1
摘要
尽管扩散方法在文本到图像生成方面表现出色,但生成准确的手势仍然是一项重大挑战,会导致严重的伪影,例如手指数量错误或手势不自然。为了使扩散模型能够学习空间信息以提高生成手部的质量,我们提出了 HanDrawer,一个对手部生成过程进行条件化的模块。具体而言,我们应用图卷积层来提取 MANO 手部网格顶点中隐含的内生空间结构和物理约束。然后,我们通过交叉注意力将这些空间特征与其他模态进行对齐和融合。空间融合特征用于指导单阶段扩散模型去噪过程,以高质量生成手部区域。为了提高空间特征融合的准确性,我们提出了一种位置保持零填充(PPZP)融合策略,该策略确保 HanDrawer 提取的特征被融合到扩散模型相关层的感兴趣区域中。得益于与去噪损失相结合的额外手部重建损失,HanDrawer 在学习整个图像特征的同时特别关注手部区域。为了准确训练和评估我们的方法,我们对广泛使用的 HaGRID 手势数据集进行了仔细的清洗和重新标注,并获得了高质量的多模态数据。定量和定性分析表明,我们的方法通过多种评估指标在 HaGRID 数据集上取得了 SOTA 性能。如果论文被接收,源代码和我们增强的数据集将公开发布。
引用
@article{arxiv.2503.02127,
title = {HanDrawer: Leveraging Spatial Information to Render Realistic Hands Using a Conditional Diffusion Model in Single Stage},
author = {Qifan Fu and Xu Chen and Muhammad Asad and Shanxin Yuan and Changjae Oh and Gregory Slabaugh},
journal= {arXiv preprint arXiv:2503.02127},
year = {2025}
}
备注
9 pages