FastVC:基于非平行数据的快速语音转换
音频与语音处理
2021-05-07 v1 机器学习
声音
摘要
本文介绍了 FastVC,一种用于快速语音转换(VC)的端到端模型。所提出的模型能够将任意长度的语音从多个源说话人转换为多个目标说话人。FastVC 基于在非平行数据上训练的条件自编码器(AE),且完全不需要标注。该模型的潜在表示被证明是与说话人无关的且类似于音素,这是 VC 系统所期望的特性。虽然当前的 VC 系统主要关注于实现最高的整体语音质量,本文试图在系统运行所需资源方面平衡开发。尽管所提模型结构简洁,其在跨语言任务上的自然度优于 VC Challenge 2020 基线。
引用
@article{arxiv.2010.04185,
title = {FastVC: Fast Voice Conversion with non-parallel data},
author = {Oriol Barbany Mayor and Milos Cernak},
journal= {arXiv preprint arXiv:2010.04185},
year = {2021}
}