利用韵律与高分辨率谱特征的高质量语音转换
声音
2015-12-08 v1
摘要
语音转换方法在过去十年中迅速发展。研究表明,说话人特征由谱特征以及各种韵律特征捕获。大多数现有转换方法关注谱特征,因为它直接代表音色特征,而一些转换方法仅关注由基频表示的韵律特征。本文提出一个利用深度神经网络转换音色与韵律特征的综合框架。音色特征由高分辨率谱特征表示。韵律特征包括 F0、强度和时长。众所周知,DNN 可作为建模高维特征的有用工具。本工作中,我们展示由我们提出的自编码器预训练初始化的 DNN 能产生高质量的 DNN 转换模型。该预训练专为语音转换量身定制,并利用自编码器捕获源语音的通用谱形状。此外,我们的框架使用分段 DNN 模型来捕获韵律特征随时间的演化。为重构转换后的语音,将由 DNN 模型产生的谱特征与由 DNN 分段模型产生的三个韵律特征相结合。我们的实验结果表明,如客观评估与主观听测所衡量,韵律与高分辨率谱特征的应用带来了高质量的转换语音。
引用
@article{arxiv.1512.01809,
title = {High quality voice conversion using prosodic and high-resolution spectral features},
author = {Hy Quy Nguyen and Siu Wa Lee and Xiaohai Tian and Minghui Dong and Eng Siong Chng},
journal= {arXiv preprint arXiv:1512.01809},
year = {2015}
}