基于变分自编码器的无声视频语音预测
计算机视觉与模式识别
2020-11-17 v1
摘要
理解听觉与视觉信号之间的关系对于从计算机生成图像(CGI)和视频编辑自动化到辅助听障或视障人士等众多不同应用至关重要。然而,这是一项挑战,因为音频和视觉模态的分布本质上都是多模态的。因此,大多数现有方法忽略多模态特性,并假设两种模态之间仅存在确定性的逐点映射。这可能导致低质量预测,因为模型退化为优化平均行为而非学习完整的数据分布。在本文中,我们提出一种用于在无声音频视频中生成语音的随机模型。所提模型结合循环神经网络与变分深度生成模型,以学习给定视觉信号条件下听觉信号的条件分布。我们基于标准基准在GRID数据集上展示了模型的性能。
引用
@article{arxiv.2011.07340,
title = {Speech Prediction in Silent Videos using Variational Autoencoders},
author = {Ravindra Yadav and Ashish Sardana and Vinay P Namboodiri and Rajesh M Hegde},
journal= {arXiv preprint arXiv:2011.07340},
year = {2020}
}