ReMoDiffuse:基于检索增强的运动扩散模型
计算机视觉与模式识别
2023-04-04 v1
摘要
三维人体运动生成对创意产业至关重要。近期进展依赖于带有领域知识的生成模型进行文本驱动的运动生成,在捕捉常见运动方面取得了实质性进展。然而,在更多样化运动上的表现仍不尽如人意。本工作中,我们提出 ReMoDiffuse,一种基于扩散模型的运动生成框架,其集成了检索机制以优化去噪过程。ReMoDiffuse 通过三项关键设计增强了文本驱动运动生成的泛化性与多样性:1)混合检索从数据库中基于语义与运动学相似性寻找合适参考;2)语义调制 Transformer 有选择地吸收检索知识,适应检索样本与目标运动序列之间的差异;3)条件混合在推理时更好地利用检索数据库,克服无分类器引导中的尺度敏感性。大量实验表明,ReMoDiffuse 在平衡文本-运动一致性与运动质量方面优于 SOTA 方法,尤其在更多样化运动生成上。
引用
@article{arxiv.2304.01116,
title = {ReMoDiffuse: Retrieval-Augmented Motion Diffusion Model},
author = {Mingyuan Zhang and Xinying Guo and Liang Pan and Zhongang Cai and Fangzhou Hong and Huirong Li and Lei Yang and Ziwei Liu},
journal= {arXiv preprint arXiv:2304.01116},
year = {2023}
}