基于多模态风格编码对抗解耦的由文本与语音驱动的零样本风格迁移手势动画
声音
2022-08-04 v1 人机交互
机器学习
音频与语音处理
摘要
为虚拟智能体建模带有行为风格是个性化人机交互的一个因素。我们提出一种高效且有效的机器学习方法,以不同说话人(包括训练时未见的说话人)的风格合成由韵律特征与文本驱动的手势。我们的模型执行由来自 PATS 数据库(含各类说话人视频)的多模态数据驱动的零样本多模态风格迁移。我们认为风格在说话时无处不在,它赋予交际行为的表现力以色彩,而语音内容由多模态信号与文本承载。这种内容与风格的解耦方案使我们能够直接推断即便训练阶段未包含其数据的说话人的风格嵌入,无需任何进一步训练或微调。我们模型的第一个目标是基于音频与文本两种模态的内容生成源说话人的手势。第二个目标是将源说话人预测手势条件化于目标说话人的多模态行为风格嵌入上。第三个目标是允许对训练时未见的说话人零样本风格迁移而无需重训模型。我们的系统包括:(1) 说话人风格编码器网络,学习从目标说话人多模态数据生成固定维说话人风格嵌入;(2) 序列到序列合成网络,基于源说话人输入模态的内容并条件于说话人风格嵌入来合成手势。我们评估表明,我们的模型能合成源说话人手势,并在零样本设定下将目标说话人风格多变性的知识迁移至手势生成任务。我们将 2D 手势转换为 3D 姿态并生成 3D 动画。我们进行客观与主观评估以验证我们的方法,并与基线比较。
引用
@article{arxiv.2208.01917,
title = {Zero-Shot Style Transfer for Gesture Animation driven by Text and Speech using Adversarial Disentanglement of Multimodal Style Encoding},
author = {Mireille Fares and Michele Grimaldi and Catherine Pelachaud and Nicolas Obin},
journal= {arXiv preprint arXiv:2208.01917},
year = {2022}
}