基于 Transformer 网络的无声码器端到端语音转换
音频与语音处理
2020-12-01 v1 机器学习
声音
机器学习
摘要
基于梅尔频率滤波器组(MFB)的方法相较于原始频谱具有学习语音的特征尺寸更小之优势。然而,采用 MFB 方法的语音生成器需要额外的声码器,其训练过程计算开销巨大。诸如 MFB 与声码器之类的额外前/后处理对于将真实人类语音转换为其他语音并非必需。仅使用原始频谱与相位即可生成发音清晰、风格各异的语音。为此,我们提出一种快速高效的并行方式,利用原始频谱转换真实语音。我们基于 Transformer 的模型架构不含任何 CNN 或 RNN 层,展现了快速学习的优势,并解决了传统 RNN 顺序计算的局限。本文引入一种利用 Transformer 网络的无声码器端到端语音转换方法。所提出的转换模型也可用于语音识别中的说话人自适应。我们的方法无需使用 MFB 与声码器即可将源语音转换为目标语音。通过将转换后的幅度与相位相乘,可获得用于语音自适应的 MFB。我们在 TIDIGITS 数据集上开展语音转换实验,分别采用自然度、相似度与清晰度指标及平均意见分(MOS)。
引用
@article{arxiv.2002.03808,
title = {Vocoder-free End-to-End Voice Conversion with Transformer Network},
author = {June-Woo Kim and Ho-Young Jung and Minho Lee},
journal= {arXiv preprint arXiv:2002.03808},
year = {2020}
}
备注
Work in progress