中文

基于随机变分深度核学习的并行有限数据语音转换

声音 2023-09-11 v1 机器学习 多媒体 音频与语音处理

摘要

通常,语音转换被视为一个训练数据有限的工程问题。对海量数据的依赖阻碍了近年来被广泛研究的深度学习方法在实际中的适用性。另一方面,统计方法在有限数据下有效,但难以建模复杂的映射函数。本文提出一种基于随机变分深度核学习(SVDKL)且适用于有限数据的语音转换方法。同时,SVDKL 能够利用深度神经网络的表现力以及高斯过程作为贝叶斯非参数方法的高度灵活性。当常规核与深度神经网络结合时,可以估计非平滑且更复杂的函数。此外,模型的稀疏变分高斯过程解决了可扩展性问题,并且与精确高斯过程不同,允许学习整个声学空间的全局映射函数。所提方案最重要的一个方面是,模型参数通过边际似然优化进行训练,该优化同时考虑数据拟合与模型复杂度。考虑模型复杂度通过增强对过拟合的抵抗力而减少了所需的训练数据量。为评估所提方案,我们使用约 80 秒的训练数据检验了模型性能。结果表明,与对比方法相比,我们的方法获得了更高的平均意见得分、更小的谱失真以及更好的偏好测试结果。

关键词

引用

@article{arxiv.2309.04420,
  title  = {Parallel and Limited Data Voice Conversion Using Stochastic Variational Deep Kernel Learning},
  author = {Mohamadreza Jafaryani and Hamid Sheikhzadeh and Vahid Pourahmadi},
  journal= {arXiv preprint arXiv:2309.04420},
  year   = {2023}
}