协同语音手势动画的风格迁移:一种多说话人条件混合方法
计算机视觉与模式识别
2020-07-27 v1 机器人学
摘要
我们如何教会机器人或虚拟助手自然地做手势?我们能否更进一步,调整手势风格以模仿特定说话者?在人类交流中,与相应语音自然同步的手势被称为协同语音手势。一个关键的挑战,称为手势风格迁移,是学习一个模型,该模型能为说话智能体‘A’生成目标说话者‘B’手势风格的手势。第二个目标是同时学习为多个说话者生成协同语音手势,同时记住每个说话者的独特之处。我们将这个挑战称为风格保持。在本文中,我们提出了一个名为 Mix-StAGE 的新模型,该模型以端到端的方式为多个说话者训练单一模型,同时为每个说话者的手势学习独特的风格嵌入。Mix-StAGE 的一个新颖之处在于学习一个生成模型混合体,从而允许以每个说话者独特的手势风格为条件。由于 Mix-StAGE 解耦了手势的风格和内容,对于相同的输入语音,只需切换风格嵌入即可改变手势风格。Mix-StAGE 还允许在同时从多个说话者学习时保持风格。我们还引入了一个新的数据集,Pose-Audio-Transcript-Style (PATS),旨在研究手势生成和风格迁移。我们提出的 Mix-StAGE 模型显著优于先前最先进的手势生成方法,并为跨多个说话者执行手势风格迁移提供了一条路径。代码、数据和视频链接:http://chahuja.com/mix-stage
引用
@article{arxiv.2007.12553,
title = {Style Transfer for Co-Speech Gesture Animation: A Multi-Speaker Conditional-Mixture Approach},
author = {Chaitanya Ahuja and Dong Won Lee and Yukiko I. Nakano and Louis-Philippe Morency},
journal= {arXiv preprint arXiv:2007.12553},
year = {2020}
}
备注
24 pages, 12 figures