关于使用矢量量化潜空间构建性能一致的TTS/VC系统的初步研究
声音
2021-06-28 v1 计算与语言
音频与语音处理
摘要
一般而言,训练神经语音合成系统的主要目标是从神经网络输出层合成自然且富有表现力的语音,而较少关注隐藏层。然而,通过学习有用的潜表示,该系统可用于更多实际场景。本文中,我们研究使用量化矢量对潜语言嵌入建模,并与连续对应物进行比较。通过对训练中的潜空间施加不同策略,我们能够获得具有不同特性且在质量与说话人相似度方面性能相近的潜语言嵌入。我们的实验表明,用矢量量化构建的语音克隆系统仅在感知评价上有微小退化,但拥有离散潜空间,有利于降低表示比特率(利于数据传输)或限制信息泄露(对说话人匿名化及此类任务至关重要)。
引用
@article{arxiv.2106.13479,
title = {Preliminary study on using vector quantization latent spaces for TTS/VC systems with consistent performance},
author = {Hieu-Thi Luong and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2106.13479},
year = {2021}
}
备注
to be presented at SSW11