中文

MCM:多条件动作合成框架

计算机视觉与模式识别 2024-11-19 v1 机器学习

摘要

条件化人体动作合成(HMS)旨在生成符合特定条件的人体动作序列。文本和音频是作为 HMS 控制条件采用的两种主要模态。现有研究主要集中于单条件,而多条件人体动作合成仍待探索。在本研究中,我们提出了一种多条件 HMS 框架,称为 MCM,基于由主分支和控制分支组成的双分支结构。该框架有效地将最初仅基于文本条件的扩散模型的适用性扩展至听觉条件。这种扩展涵盖了从音乐到舞蹈以及伴随语音的 HMS,同时保持了动作的内在质量和原模型固有的语义关联能力。此外,我们提出将一种基于 Transformer 的扩散模型,命名为 MWNet,作为主分支。该模型通过集成多维度自注意力模块,巧妙地捕获了动作序列中固有的空间复杂性和关节间相关性。大量实验表明,我们的方法在单条件和多条件 HMS 任务中均取得了具有竞争力的结果。

关键词

引用

@article{arxiv.2404.12886,
  title  = {MCM: Multi-condition Motion Synthesis Framework},
  author = {Zeyu Ling and Bo Han and Yongkang Wongkan and Han Lin and Mohan Kankanhalli and Weidong Geng},
  journal= {arXiv preprint arXiv:2404.12886},
  year   = {2024}
}