中文

DiffusionPhase:频域中的运动扩散

计算机视觉与模式识别 2023-12-08 v1 机器学习

摘要

在本研究中,我们引入了一种基于学习的方法,用于从文本描述(例如,“一个人向前走”)生成高质量的人体运动序列。由于文本到运动数据集的有限性以及所使用的姿态表示通常缺乏表达能力或紧凑性,现有技术在生成任意长度运动序列时面临运动多样性和平滑过渡的困难。为了解决这些问题,我们提出了第一种在运动频域中进行文本条件人体运动生成的方法。我们开发了一个网络编码器,将运动空间转换为紧凑且富有表现力的参数化相位空间,并编码了高频细节,以高精度捕捉运动在时间和空间上的局部周期性。我们还引入了一个条件扩散模型,用于基于文本描述和起始姿态预测周期性运动参数,有效地实现了与不同文本描述相关联的运动序列之间的平滑过渡。实验表明,我们的方法在生成更多样化的高质量运动以及合成具有自然过渡的长序列方面优于现有方法。

关键词

引用

@article{arxiv.2312.04036,
  title  = {DiffusionPhase: Motion Diffusion in Frequency Domain},
  author = {Weilin Wan and Yiming Huang and Shutong Wu and Taku Komura and Wenping Wang and Dinesh Jayaraman and Lingjie Liu},
  journal= {arXiv preprint arXiv:2312.04036},
  year   = {2023}
}