中文

NWT:面向自然音视频生成的表示学习

声音 2021-06-09 v1 人工智能 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

在这项工作中,我们介绍 NWT,一个富有表现力的语音到视频模型。与使用诸如姿态关键点等特定领域中间表示的方法不同,NWT 学习自身的潜在表示,对音频和视频内容做出最小假设。为此,我们提出了一种带对抗损失的新型离散变分自编码器 dVAE-Adv,它学习了一种我们称为 Memcodes 的新离散潜在表示。Memcodes 易于实现,不需要额外的损失项,与其他方法相比训练稳定,并展现出可解释性证据。为了在 Memcode 空间上进行预测,我们使用以音频为条件的自回归编码器-解码器模型。此外,我们的模型能控制生成视频中数据未标注的潜在属性。我们在 HBO 的 Last Week Tonight with John Oliver 节目片段上训练 NWT。在整体视频自然度、面部自然度与表现力以及唇形同步质量的测试中,NWT 的平均意见得分(MOS)持续高于其他方法。本工作为通用音频到视频合成奠定了坚实基础。样本可在 https://next-week-tonight.github.io/NWT/ 获取。

关键词

引用

@article{arxiv.2106.04283,
  title  = {NWT: Towards natural audio-to-video generation with representation learning},
  author = {Rayhane Mama and Marc S. Tyndel and Hashiam Kadhim and Cole Clifford and Ragavan Thurairatnam},
  journal= {arXiv preprint arXiv:2106.04283},
  year   = {2021}
}