基于预训练扩散模型的统一人体运动合成
计算机视觉与模式识别
2022-12-07 v1 图形学
机器学习
机器人学
摘要
人体运动的生成建模在计算机动画、虚拟现实与机器人领域有广泛应用。传统方法针对不同运动合成任务分别开发模型,且通常使用小模型以避免各场景下稀缺数据的过拟合。开发一个单一统一模型是否可行仍是一个开放问题,其可能 1)通过组合从多任务中学到的技能而有益于获得新技能,以及 2)通过组合多数据源帮助在不过拟合的情况下增大模型容量。统一具有挑战性,因为 1)它涉及多样的控制信号以及不同粒度的目标,且 2)运动数据集可能使用不同的骨架与默认姿态。本文提出 MoFusion,一个用于统一运动合成的框架。MoFusion 采用 Transformer 主干,通过交叉注意力简便地纳入多样控制信号,并将该主干预训练为扩散模型,以支持从身体部位运动补全到全身运动生成的多粒度合成。它使用可学习适配器来适应预训练与微调数据所用默认骨架之间的差异。实验结果表明,预训练对于在不发生过拟合的情况下扩展模型规模至关重要,并展示了 MoFusion 在文本到运动、运动补全及多控制信号零样本混合等多种任务中的潜力。项目主页:\url{https://ofa-sys.github.io/MoFusion/}。
引用
@article{arxiv.2212.02837,
title = {Pretrained Diffusion Models for Unified Human Motion Synthesis},
author = {Jianxin Ma and Shuai Bai and Chang Zhou},
journal= {arXiv preprint arXiv:2212.02837},
year = {2022}
}