面向多样化三维协同语音手势生成的弱监督情绪过渡学习
计算机视觉与模式识别
2024-03-28 v3
摘要
生成生动且富有情绪的三维协同语音手势对于人机交互应用中的虚拟化身动画至关重要。现有方法虽能生成遵循单一情绪标签的手势,却忽视了在真实场景中长手势序列的情绪过渡建模更具实用性。此外,缺乏带有情绪过渡语音及相应三维人体手势的大规模可用数据集也限制了该任务的解决。为实现这一目标,我们首先结合 ChatGPT-4 与音频修复方法构建高保真情绪过渡人声语音。考虑到获取与动态修复的情绪过渡音频相对应的真实三维姿态标注极为困难,我们提出一种新颖的弱监督训练策略以促使权威的手势过渡。具体而言,为增强过渡手势相对于不同情绪手势的协调性,我们将两段不同情绪手势序列之间的时间关联表征建模为风格引导,并将其注入过渡生成中。我们进一步设计了一种情绪混合机制,基于可学习的混合情绪标签为过渡手势提供弱监督。最后,我们提出一种关键帧采样器,在长序列中提供有效的初始姿态线索,使我们能够生成多样化手势。大量实验表明,在我们新定义的情绪过渡任务与数据集上,我们的方法优于通过改编单一情绪条件对应模型所构建的当前最优模型。我们的代码与数据集将在项目页面发布:https://xingqunqi-lab.github.io/Emo-Transition-Gesture/。
引用
@article{arxiv.2311.17532,
title = {Weakly-Supervised Emotion Transition Learning for Diverse 3D Co-speech Gesture Generation},
author = {Xingqun Qi and Jiahao Pan and Peng Li and Ruibin Yuan and Xiaowei Chi and Mengfei Li and Wenhan Luo and Wei Xue and Shanghang Zhang and Qifeng Liu and Yike Guo},
journal= {arXiv preprint arXiv:2311.17532},
year = {2024}
}
备注
Accepted by CVPR 2024