FastS2S-VC:流式非自回归序列到序列语音转换
声音
2021-04-15 v1 音频与语音处理
摘要
本文对我们先前提出的基于序列到序列(S2S)模型的语音转换(VC)方法提出了一种非自回归扩展。基于 S2S 模型的 VC 方法近年来备受关注,得益于带有注意力机制的编码器-解码器架构,其不仅能灵活转换说话人身份,还可转换输入语音的音高轮廓与局部时长。然而,使这些方法实时工作的障碍之一是其自回归(AR)结构。为克服该障碍,我们基于师生学习框架开发了一种获得无 AR 结构且行为类似于原始 S2S 模型的方法。在我们称为“FastS2S-VC”的方法中,学生模型由编码器、解码器和注意力预测器组成。注意力预测器在教师模型根据源语音和目标语音预测的注意力分布指导下,学习仅从源语音及目标类别索引预测注意力分布。得益于该结构,模型摆脱了 AR 结构并允许并行化。此外,我们展示了 FastS2S-VC 适合基于滑动窗口方法的实时实现,并描述了使其实时运行的方式。通过说话人身份与情感表达转换实验,我们确认 FastS2S-VC 相比原始 AR 型 S2S-VC 方法能将转换过程加速 70 至 100 倍,且不显著劣化音频质量及与目标语音的相似度。我们还确认实时版 FastS2S-VC 在 GPU 上运行时可实现 32 ms 的延迟。
引用
@article{arxiv.2104.06900,
title = {FastS2S-VC: Streaming Non-Autoregressive Sequence-to-Sequence Voice Conversion},
author = {Hirokazu Kameoka and Kou Tanaka and Takuhiro Kaneko},
journal= {arXiv preprint arXiv:2104.06900},
year = {2021}
}