中文

AE-Flow:自编码器归一化流

声音 2023-12-29 v1 机器学习 音频与语音处理

摘要

最近,归一化流在文本到语音(TTS)和语音转换(VC)中因其最先进的性能而受到关注。归一化流是无监督生成模型。在本文中,我们引入了监督到归一化流的训练过程中,无需并行数据。我们将这种训练范式称为自编码器归一化流(AE-Flow)。它添加了一个重构损失,迫使模型使用条件信息来重构音频样本。我们的目标是理解每个组件的影响,并找到在训练具有耦合块的归一化流时负对数似然(NLL)和重构损失的正确组合。为此,我们将比较使用以下方式训练的基于流的映射模型:(i)NLL损失,(ii)NLL和重构损失,以及(iii)仅重构损失。此外,我们将我们的模型与最先进的VC基线进行比较。模型在自然度、说话人相似度、可懂度方面进行评估,包括多对多和多对任意VC设置。结果表明,与归一化流的常规训练方法相比,所提出的训练范式系统地提高了说话人相似度和自然度。此外,我们表明我们的方法在说话人相似度和可懂度上优于最先进的方法。

关键词

引用

@article{arxiv.2312.16552,
  title  = {AE-Flow: AutoEncoder Normalizing Flow},
  author = {Jakub Mosiński and Piotr Biliński and Thomas Merritt and Abdelhamid Ezzerg and Daniel Korzekwa},
  journal= {arXiv preprint arXiv:2312.16552},
  year   = {2023}
}

备注

ICASSP 2023