GraspDiffusion:用于合成真实全身手-物体交互的扩散模型
计算机视觉与模式识别
2025-12-01 v3
摘要
最近的生成模型能够合成高质量图像,但往往无法生成人手与物体交互的情景。这主要源于模型对此类交互的误解以及合成复杂身体部位的困难。本文提出了 \textbf{GraspDiffusion},一种创新的生成方法,用于创建真实的人-物体交互场景。给定 3D 物体,GraspDiffusion 构建全身姿态,可控制物体相对于人体位置,这通过分别利用身体和手部姿态的生成先验来实现,将其优化为具有抓握姿态的联合姿态。这种姿态指导图像合成,正确地反映预期的交互,创建真实且多样化的人-物体交互场景。我们证明了 GraspDiffusion 能够成功解决尚未充分探讨的全身人-物体交互生成问题,同时优于先前方法。我们的项目页面已公开 https://yj7082126.github.io/graspdiffusion/
关键词
引用
@article{arxiv.2410.13911,
title = {GraspDiffusion: Synthesizing Realistic Whole-body Hand-Object Interaction},
author = {Patrick Kwon and Chen Chen and Hanbyul Joo},
journal= {arXiv preprint arXiv:2410.13911},
year = {2025}
}
备注
Paper has been accepted to WACV 2026