中文

Audio2Gestures:利用条件变分自编码器从语音音频生成多样化手势

计算机视觉与模式识别 2021-08-17 v1

摘要

从语音音频生成对话手势具有挑战性,因为音频与身体动作之间天然存在一对多映射。常规 CNN/RNN 假设为一对一映射,因而倾向于预测所有可能目标动作的平均值,导致推理期间动作平淡无趣。为克服该问题,我们提出一种新颖的条件变分自编码器(VAE),通过将跨模态潜码拆分为共享码和动作专属码,显式建模一对多音频到动作映射。共享码主要建模音频与动作间的强相关性(如同步的音频与动作节拍),而动作专属码捕获独立于音频的多样化动作信息。然而,将潜码拆分为两部分给 VAE 模型带来训练困难。设计了一个促进随机采样的映射网络,以及包括松弛动作损失、自行车约束和多样性损失在内的其他技术,以更好地训练 VAE。在 3D 和 2D 动作数据集上的实验从定量和定性上验证了我们的方法比最先进方法生成更真实且多样的动作。最后,我们展示了我们的方法可轻松用于生成时间线上带用户指定动作片段的动作序列。代码和更多结果见 https://jingli513.github.io/audio2gestures。

关键词

引用

@article{arxiv.2108.06720,
  title  = {Audio2Gestures: Generating Diverse Gestures from Speech Audio with Conditional Variational Autoencoders},
  author = {Jing Li and Di Kang and Wenjie Pei and Xuefei Zhe and Ying Zhang and Zhenyu He and Linchao Bao},
  journal= {arXiv preprint arXiv:2108.06720},
  year   = {2021}
}