中文

用于声音变形的端到端扩张变分自编码器与瓶颈判别损失——初步研究

机器学习 2020-11-20 v1 声音 音频与语音处理

摘要

我们提出一项关于用于声音变形的端到端变分自编码器(VAE)的初步研究。比较了两种VAE变体:带扩张层的VAE(DC-VAE)与仅带常规卷积层的VAE(CC-VAE)。我们组合了如下损失函数:1)用于重建输入信号的时域均方误差,2)瓶颈层到标准正态分布的Kullback-Leibler散度,3)由瓶颈表示计算出的分类损失。在一个口语数字库上,我们使用1-最近邻分类表明声音类别在瓶颈层中分离。我们引入梅尔频率倒谱系数动态时间规整(MFCC-DTW)偏差,作为VAE解码器将该类在潜(瓶颈)层中的类中心投影到音频域中该类声音中心之程度的度量。就MFCC-DTW偏差与1-NN分类而言,DC-VAE优于CC-VAE。针对我们的参数化与数据集的这些结果表明,DC-VAE比CC-VAE更适于声音变形,因为DC-VAE解码器在从音频域映射到潜空间时更好地保持了拓扑结构。给出了口语数字与鼓声变形的实例。

关键词

引用

@article{arxiv.2011.09744,
  title  = {End-To-End Dilated Variational Autoencoder with Bottleneck Discriminative Loss for Sound Morphing -- A Preliminary Study},
  author = {Matteo Lionello and Hendrik Purwins},
  journal= {arXiv preprint arXiv:2011.09744},
  year   = {2020}
}