中文

基于 DBLSTM 的语音转换的误差抑制网络

音频与语音处理 2018-09-27 v1

摘要

迄今为止,许多用于语音转换的深度学习方法利用大量训练数据生成高质量语音。本文提出一种基于深度双向长短期记忆(DBLSTM)的语音转换框架,可在有限训练数据下工作。我们提出构建基于 DBLSTM 的平均模型,该模型使用多说话人数据进行训练。随后,我们提出利用有限目标数据进行自适应。最后,我们提出一种误差抑制网络,可进一步提升语音转换质量。所提框架受三点观察启发:其一,DBLSTM 通过考虑语音语句的长程依赖可实现卓越的语音转换;其二,基于 DBLSTM 的平均模型可用少量数据轻松自适应,从而获得更接近目标的语音;其三,误差抑制网络可用少量训练数据训练,并有效改善转换质量。实验表明,所提语音转换框架能灵活处理有限训练数据,且在客观与主观评价中均优于传统框架。

关键词

引用

@article{arxiv.1809.09841,
  title  = {Error Reduction Network for DBLSTM-based Voice Conversion},
  author = {Mingyang Zhang and Berrak Sisman and Sai Sirisha Rallabandi and Haizhou Li and Li Zhao},
  journal= {arXiv preprint arXiv:1809.09841},
  year   = {2018}
}

备注

Accepted by APSIPA 2018