中文

Monkey See, Monkey Do: Harnessing Self-attention in Motion Diffusion for Zero-shot Motion Transfer

计算机视觉与模式识别 2024-06-11 v1 人工智能 图形学

摘要

鉴于扩散模型在运动合成方面取得的显著成果,一个自然的问题随之而来:我们如何有效地利用这些模型进行运动编辑?现有的基于扩散的运动编辑方法忽视了预训练模型权重中内嵌的巨大潜力,这种潜力使得我们能够操控潜在特征空间;因此,这些方法主要集中在处理运动空间。本文我们探索了预训练运动扩散模型中的注意力机制。我们发现注意力元素在捕获和表示复杂人类运动模式中的作用与相互作用,并小心地整合这些元素在保持跟随者细微特征的同时,将领导者运动传递给跟随者,实现零样本运动传递。与使用通用指令(如文本、音乐)进行编辑的先前运动扩散方法不同,我们通过编辑与所选运动相关的特征,成功传达了细微细节。我们的工作灵感来自猴子 closely imitates what it sees while maintaining its unique motion patterns 的方式;因此我们称之为 Monkey See, Monkey Do,称其为 MoMo。运用我们的技术可以完成诸如合成超出分布运动、风格迁移和空间编辑等任务。此外,扩散反转在运动领域鲜有被使用,因此编辑工作仅限于生成的运动,限制了真实运动的可编辑性。MoMo 利用运动反转,将其应用扩展到真实与生成运动两者。实验结果表明,我们的方法优于当前主流方法。特别是与通过特定应用训练的模型不同,我们的方法在推理阶段使用,无需训练。我们的网页地址为 https://monkeyseedocg.github.io。

关键词

引用

@article{arxiv.2406.06508,
  title  = {Monkey See, Monkey Do: Harnessing Self-attention in Motion Diffusion for Zero-shot Motion Transfer},
  author = {Sigal Raab and Inbar Gat and Nathan Sala and Guy Tevet and Rotem Shalev-Arkushin and Ohad Fried and Amit H. Bermano and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2406.06508},
  year   = {2024}
}

备注

Video: https://www.youtube.com/watch?v=s5oo3sKV0YU, Project page: https://monkeyseedocg.github.io, Code: https://github.com/MonkeySeeDoCG/MoMo-code