中文

从视频扩散模型中获取运动

计算机视觉与模式识别 2024-11-21 v1

摘要

文本条件的视频扩散模型已成为视频生成与编辑领域的强大工具。但其捕捉人类运动细微差别的能力仍有待探索。事实上,这些模型忠实建模大量文本提示的能力,可在人类与角色动画中带来广泛的应用。在本工作中,我们迈出了初步步伐,研究这些模型能否有效指导逼真人体动画的合成。具体而言,我们提出通过使用视频扩散模型计算的Score distillation sampling (SDS) 引导,对SMPL-X人体表示进行变形来合成人类运动。通过分析生成动画的保真度,我们深入了解了利用公开可用的文本到视频扩散模型通过SDS获取运动的程度。我们的发现揭示了这些模型在生成多样且合理的人类运动方面的潜力与局限性,为这一令人兴奋的领域的进一步研究铺平了道路。

关键词

引用

@article{arxiv.2411.12831,
  title  = {Towards motion from video diffusion models},
  author = {Paul Janson and Tiberiu Popa and Eugene Belilovsky},
  journal= {arXiv preprint arXiv:2411.12831},
  year   = {2024}
}

备注

Accepted at ECCV 2024 Workshop :Foundation Models for 3D Humans