中文

基于非自回归序列到序列模型的语音转换

声音 2021-04-15 v1 计算与语言 音频与语音处理

摘要

本文提出一种基于非自回归序列到序列(NAR-S2S)模型的新型语音转换(VC)方法。受 FastSpeech 等 NAR-S2S 模型在文本到语音(TTS)中巨大成功的启发,我们将 FastSpeech2 模型拓展用于 VC 问题。我们引入卷积增强 Transformer(Conformer)替代 Transformer,从而能够从输入序列中捕获局部与全局上下文信息。此外,我们将方差预测器拓展为方差转换器,以显式地将源说话人的韵律成分(如音高与能量)转换为目标说话人。使用由男女说话人各 1,000 条语音组成的日语说话人数据集进行的实验评估表明,所提模型相比 Tacotron2 和 Transformer 等自回归 S2S(AR-S2S)模型能够实现更稳定、更快速且更好的转换。

关键词

引用

@article{arxiv.2104.06793,
  title  = {Non-autoregressive sequence-to-sequence voice conversion},
  author = {Tomoki Hayashi and Wen-Chin Huang and Kazuhiro Kobayashi and Tomoki Toda},
  journal= {arXiv preprint arXiv:2104.06793},
  year   = {2021}
}

备注

Accepted to ICASSP2021. Demo HP: https://kan-bayashi.github.io/NonARSeq2SeqVC/