基于范例自编码器的无监督视听合成
计算机视觉与模式识别
2021-07-06 v3 机器学习
多媒体
声音
音频与语音处理
摘要
我们提出一种无监督方法,可将任意个体的输入语音转换为潜在无限多个输出说话人的视听流。我们的方法建立在简单自编码器之上,这些自编码器将样本外数据投影到训练集的分布上。我们使用范例自编码器(Exemplar Autoencoders)来学习特定目标范例语音的嗓音、风格化韵律与视觉外观。与现有方法不同,所提方法仅需 3 分钟目标音视频数据,且不需要输入说话人的任何训练数据,即可轻松扩展到任意数量的说话人与风格。为此,我们学习捕捉语音结构化语言内容的视听瓶颈表示。我们在音频与视频合成上均优于先前方法,并在项目页面 https://www.cs.cmu.edu/~exemplar-ae/ 提供了广泛的定性分析。
引用
@article{arxiv.2001.04463,
title = {Unsupervised Audiovisual Synthesis via Exemplar Autoencoders},
author = {Kangle Deng and Aayush Bansal and Deva Ramanan},
journal= {arXiv preprint arXiv:2001.04463},
year = {2021}
}
备注
ICLR 2021; Project page -- https://www.cs.cmu.edu/~exemplar-ae/