MediumVC:以合成特定说话人语音作为中间特征的任意到任意语音转换
音频与语音处理
2021-10-07 v1
摘要
为实现任意到任意(A2A)语音转换(VC),多数方法采用对称自监督重构任务(Xi到Xi),常因特征解耦不充分导致性能低效,尤其对未见说话人。我们提出一种以合成特定说话人语音作为中间特征的两阶段重构任务(Xi到Yi到Xi),将A2A VC划分为两阶段:任意到一(A2O)与一到任意(O2A)。在A2O阶段,我们提出新A2O方法SingleVC,采用新颖数据增强策略(移调保时,PSDR)完成Xi到Yi。在O2A阶段,基于预训练SingleVC提出MediumVC以执行Yi到Xi。通过此类非对称重构任务(SingleVC中Xi到Yi,MediumVC中Yi到Xi),模型可有目的地捕获鲁棒解耦特征。实验表明MediumVC能在保持高自然度的同时提升转换语音相似度。
引用
@article{arxiv.2110.02500,
title = {MediumVC: Any-to-any voice conversion using synthetic specific-speaker speeches as intermedium features},
author = {Yewei Gu and Zhenyu Zhang and Xiaowei Yi and Xianfeng Zhao},
journal= {arXiv preprint arXiv:2110.02500},
year = {2021}
}
备注
5 pages, 2 figures