中文

GraspDiffusion:用于合成真实全身手-物体交互的扩散模型

计算机视觉与模式识别 2025-12-01 v3

摘要

最近的生成模型能够合成高质量图像,但往往无法生成人手与物体交互的情景。这主要源于模型对此类交互的误解以及合成复杂身体部位的困难。本文提出了 \textbf{GraspDiffusion},一种创新的生成方法,用于创建真实的人-物体交互场景。给定 3D 物体,GraspDiffusion 构建全身姿态,可控制物体相对于人体位置,这通过分别利用身体和手部姿态的生成先验来实现,将其优化为具有抓握姿态的联合姿态。这种姿态指导图像合成,正确地反映预期的交互,创建真实且多样化的人-物体交互场景。我们证明了 GraspDiffusion 能够成功解决尚未充分探讨的全身人-物体交互生成问题,同时优于先前方法。我们的项目页面已公开 https://yj7082126.github.io/graspdiffusion/

关键词

引用

@article{arxiv.2410.13911,
  title  = {GraspDiffusion: Synthesizing Realistic Whole-body Hand-Object Interaction},
  author = {Patrick Kwon and Chen Chen and Hanbyul Joo},
  journal= {arXiv preprint arXiv:2410.13911},
  year   = {2025}
}

备注

Paper has been accepted to WACV 2026