中文

ReMoDiffuse:基于检索增强的运动扩散模型

计算机视觉与模式识别 2023-04-04 v1

摘要

三维人体运动生成对创意产业至关重要。近期进展依赖于带有领域知识的生成模型进行文本驱动的运动生成,在捕捉常见运动方面取得了实质性进展。然而,在更多样化运动上的表现仍不尽如人意。本工作中,我们提出 ReMoDiffuse,一种基于扩散模型的运动生成框架,其集成了检索机制以优化去噪过程。ReMoDiffuse 通过三项关键设计增强了文本驱动运动生成的泛化性与多样性:1)混合检索从数据库中基于语义与运动学相似性寻找合适参考;2)语义调制 Transformer 有选择地吸收检索知识,适应检索样本与目标运动序列之间的差异;3)条件混合在推理时更好地利用检索数据库,克服无分类器引导中的尺度敏感性。大量实验表明,ReMoDiffuse 在平衡文本-运动一致性与运动质量方面优于 SOTA 方法,尤其在更多样化运动生成上。

关键词

引用

@article{arxiv.2304.01116,
  title  = {ReMoDiffuse: Retrieval-Augmented Motion Diffusion Model},
  author = {Mingyuan Zhang and Xinying Guo and Liang Pan and Zhongang Cai and Fangzhou Hong and Huirong Li and Lei Yang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2304.01116},
  year   = {2023}
}