中文

基于范例自编码器的无监督视听合成

计算机视觉与模式识别 2021-07-06 v3 机器学习 多媒体 声音 音频与语音处理

摘要

我们提出一种无监督方法,可将任意个体的输入语音转换为潜在无限多个输出说话人的视听流。我们的方法建立在简单自编码器之上,这些自编码器将样本外数据投影到训练集的分布上。我们使用范例自编码器(Exemplar Autoencoders)来学习特定目标范例语音的嗓音、风格化韵律与视觉外观。与现有方法不同,所提方法仅需 3 分钟目标音视频数据,且不需要输入说话人的任何训练数据,即可轻松扩展到任意数量的说话人与风格。为此,我们学习捕捉语音结构化语言内容的视听瓶颈表示。我们在音频与视频合成上均优于先前方法,并在项目页面 https://www.cs.cmu.edu/~exemplar-ae/ 提供了广泛的定性分析。

关键词

引用

@article{arxiv.2001.04463,
  title  = {Unsupervised Audiovisual Synthesis via Exemplar Autoencoders},
  author = {Kangle Deng and Aayush Bansal and Deva Ramanan},
  journal= {arXiv preprint arXiv:2001.04463},
  year   = {2021}
}

备注

ICLR 2021; Project page -- https://www.cs.cmu.edu/~exemplar-ae/