Combo:面向语音与人体运动协同生成的高效定制化框架
计算机视觉与模式识别
2025-09-22 v2
摘要
我们提出了一种新颖的框架 Combo,用于语音与人体运动的协同生成。我们指出,该生成模型的一个基本挑战在于其多输入多输出(MIMO)特性。具体而言,在输入侧,模型通常同时消费语音信号和角色引导信息(如身份和情感),这不仅对学习能力提出了挑战,也阻碍了模型对不同引导信息的进一步适配;在输出侧,整体的人体运动主要由面部表情和身体动作组成,这两者在本质上相互关联,但在当前基于数据驱动的生成过程中却难以协调。针对上述挑战,我们为两端都提出了定制化设计。对于输入侧,我们提出在固定身份和中性情感的数据上进行预训练,并将可定制条件(身份和情感)的融入推迟到微调阶段,这一阶段由我们新颖的 X-Adapter 通过参数高效微调技术来增强。对于输出侧,我们提出了一种简单而有效的 Transformer 设计 DU-Trans,它首先分为两个分支分别学习面部表情和身体动作的个体特征,然后将它们联合起来学习一个双向联合分布,并直接预测组合系数。在 BEAT2 和 SHOW 数据集上的评估表明,Combo 在生成高质量动作方面非常有效,并且在迁移身份和情感方面也很高效。项目网站:\href{https://xc-csc101.github.io/combo/}{Combo}。
关键词
引用
@article{arxiv.2408.09397,
title = {Combo: Co-speech holistic 3D human motion generation and efficient customizable adaptation in harmony},
author = {Chao Xu and Mingze Sun and Zhi-Qi Cheng and Fei Wang and Yang Liu and Baigui Sun and Ruqi Huang and Alexander Hauptmann},
journal= {arXiv preprint arXiv:2408.09397},
year = {2025}
}
备注
Accepted to TPAMI