中文

用于语音转换的序列到序列声学建模

声音 2020-01-14 v5 音频与语音处理

摘要

本文提出了一种名为序列到序列转换网络(SCENT)的神经网络,用于语音转换中的声学建模。在训练阶段,通过使用注意力机制隐式对齐源说话人和目标说话人的特征序列来估计SCENT模型。在转换阶段,使用统一的声学模型同时转换源话语的声学特征和时长。采用梅尔尺度谱图作为声学特征,其包含语音信号的激励和声道描述。使用自动语音识别(ASR)模型从源语音提取的瓶颈特征作为辅助输入附加。构建了一个以梅尔谱图为条件的WaveNet声码器,以从SCENT模型的输出重建波形。值得注意的是,我们提出的方法能够实现合适的时长转换,这在传统方法中是困难的。实验结果表明,我们提出的方法比使用高斯混合模型(GMM)和深度神经网络(DNN)作为声学模型的基线方法取得了更好的客观和主观性能。该提出的方法也优于我们在Voice Conversion Challenge 2018中获得排名第一的先前工作。消融实验进一步证实了我们所提方法中若干组件的有效性。

关键词

引用

@article{arxiv.1810.06865,
  title  = {Sequence-to-Sequence Acoustic Modeling for Voice Conversion},
  author = {Jing-Xuan Zhang and Zhen-Hua Ling and Li-Juan Liu and Yuan Jiang and Li-Rong Dai},
  journal= {arXiv preprint arXiv:1810.06865},
  year   = {2020}
}

备注

Published on IEEE/ACM Transactions on Audio, Speech and Language Processing