基于自监督语音表示的语音转换比较研究
声音
2022-11-23 v1 机器学习
音频与语音处理
摘要
我们提出了一项基于自监督语音表示(S3R)的语音转换(VC)的大规模比较研究。在识别-合成式 VC 的框架下,S3R 因其有望替代昂贵的监督表示(如音素后验图(PPG))而颇具吸引力,后者被当前最先进的 VC 系统广泛采用。利用我们此前开发的开源 VC 软件 S3PRL-VC,我们在三种 VC 设定下使用语音转换挑战赛 2020(VCC2020)数据集进行了一系列深入的客观与主观分析:语内/跨语言任意到一(A2O)以及任意到任意(A2A)VC。我们从模型类型、多语言性及监督方式等多个方面研究了基于 S3R 的 VC。我们还研究了基于 k-means 聚类的离散化后处理过程的效果,并展示了其在 A2A 设定中的改进。最后,与最先进 VC 系统的比较证明了基于 S3R 的 VC 的竞争力,并揭示了可能的改进方向。
引用
@article{arxiv.2207.04356,
title = {A Comparative Study of Self-supervised Speech Representation Based Voice Conversion},
author = {Wen-Chin Huang and Shu-Wen Yang and Tomoki Hayashi and Tomoki Toda},
journal= {arXiv preprint arXiv:2207.04356},
year = {2022}
}
备注
Accepted to IEEE Journal of Selected Topics in Signal Processing. arXiv admin note: substantial text overlap with arXiv:2110.06280