DAViD:使用预训练视频扩散模型建模3D对象的动态 affordance
计算机视觉与模式识别
2025-08-12 v3
摘要
建模人类如何与物体交互对于AI有效地帮助或模拟人类行为至关重要。现有研究主要关注静态人物-物体交互(HOI)模式,如接触和空间关系,而捕捉人物和物体随时间运动的动态HOI模式则相对不被充分探索。本文提出了一种新型框架,用于学习各种目标物体类别的动态affordance。为解决4D HOI数据稀缺问题,我们的方法从合成生成的4D HOI样本中学习3D动态affordance。具体而言,我们提出了一条管道:首先使用预训练视频扩散模型从给定的3D目标物体生成2D HOI视频,然后将其提升至3D以生成4D HOI样本。利用这些合成的4D HOI样本,我们训练了DAViD——我们的生成式4D人物-物体交互模型,由两个关键组件组成:(1)具备低秩适应(LoRA)模块的人体运动扩散模型(MDM),用于从有限的HOI运动样本中学习HOI运动概念,(2)以生成的人体交互运动为条件的4D物体姿态运动扩散模型。值得注意的是,DAViD能够将新学到的HOI运动概念与预训练的人体运动集成,以创建新的HOI运动,甚至可以处理多个HOI运动概念,显示示了我们管道在整合动态HOI概念方面的优势。通过大量实验,我们证明DAViD在合成HOI运动方面优于基线方法。
引用
@article{arxiv.2501.08333,
title = {DAViD: Modeling Dynamic Affordance of 3D Objects Using Pre-trained Video Diffusion Models},
author = {Hyeonwoo Kim and Sangwon Baik and Hanbyul Joo},
journal= {arXiv preprint arXiv:2501.08333},
year = {2025}
}
备注
Project Page: https://snuvclab.github.io/david/