基于提示的协语气体运动生成中的协同全身控制
计算机视觉与模式识别
2024-10-02 v1
摘要
当前协语气体运动生成方法通常仅关注跟随语音内容的上半身手势,缺乏对基于文本提示进行协同全身运动控制的能力,如边说话边走动。主要挑战在于:1)现有的语音到运动数据集仅包含高度有限的全身运动,使大量常见人类活动超出训练分布;2)这些数据集也缺乏用户提示的注释。为此,我们提出了SynTalker,通过利用开箱即用的文本到运动数据集作为辅助,补充缺失的全身运动和提示。核心技术贡献有两个方面:一是多阶段训练过程,以获得运动、语音和提示之间的对齐嵌入空间,尽管语音到运动和文本到运动数据集之间的运动分布存在显著差异。另一是基于扩散的条件推理过程,采用分离-合并策略实现局部身体部位的精细控制。进行了大量实验以验证我们的方法支持基于语音和用户提示的协同全身运动生成的精确和灵活控制,这超越了现有方法的能力。
引用
@article{arxiv.2410.00464,
title = {Enabling Synergistic Full-Body Control in Prompt-Based Co-Speech Motion Generation},
author = {Bohong Chen and Yumeng Li and Yao-Xiang Ding and Tianjia Shao and Kun Zhou},
journal= {arXiv preprint arXiv:2410.00464},
year = {2024}
}
备注
Project Page: https://robinwitch.github.io/SynTalker-Page