ALO-VC:任意到任意的低延迟单次语音转换
音频与语音处理
2023-06-05 v1 机器学习
声音
摘要
本文提出 ALO-VC,一种基于非并行低延迟单次音素后验图(PPGs)的语音转换方法。ALO-VC 仅使用目标说话人的一句语音,且仅有 47.5 ms 的未来前瞻,即可实现任意到任意的语音转换。所提出的混合信号处理与机器学习流程结合了预训练的说话人编码器、用于预测转换后语音韵律的音高预测器,以及用于传递音素位置信息的位置编码。我们介绍了两个系统版本:ALO-VC-R 使用预训练的 d-vector 说话人编码器,ALO-VC-E 使用 ECAPA-TDNN 说话人编码器以提升性能。实验结果表明,ALO-VC-R 和 ALO-VC-E 在 VCTK 数据集和两个域外数据集上均能取得与非因果基线系统相当的性能。此外,两个所提系统均可部署在单 CPU 核上,具有 55 ms 延迟和 0.78 的实时因子。我们的演示已在线提供。
引用
@article{arxiv.2306.01100,
title = {ALO-VC: Any-to-any Low-latency One-shot Voice Conversion},
author = {Bohan Wang and Damien Ronssin and Milos Cernak},
journal= {arXiv preprint arXiv:2306.01100},
year = {2023}
}
备注
Accepted to Interspeech 2023. Some audio samples are available at https://bohan7.github.io/ALO-VC-demo/