VQVC+:基于矢量量化和U-Net架构的一次性语音转换
音频与语音处理
2020-06-09 v1 机器学习
声音
摘要
语音转换(VC)是一项将源说话人的音色、口音和语调转换为另一人同时保留语言内容的任务。这仍是一项具有挑战性的工作,尤其在一次性设定下。基于自编码器的VC方法在无需给定说话人身份的情况下解耦输入语音中的说话人与内容,因此这些方法可进一步泛化至未见说话人。该解耦能力通过矢量量化(VQ)、对抗训练或实例归一化(IN)实现。然而,不完美的解耦可能损害输出语音质量。在本工作中,为进一步提升音频质量,我们在基于自编码器的VC系统中使用U-Net架构。我们发现要利用U-Net架构,强大的信息瓶颈是必要的。基于VQ的方法量化潜向量,可服务于该目的。客观与主观评估表明,所提方法在音频自然度和说话人相似度上均表现良好。
引用
@article{arxiv.2006.04154,
title = {VQVC+: One-Shot Voice Conversion by Vector Quantization and U-Net architecture},
author = {Da-Yi Wu and Yen-Hao Chen and Hung-Yi Lee},
journal= {arXiv preprint arXiv:2006.04154},
year = {2020}
}