AttS2S-VC:具有注意力与上下文保持机制的序列到序列语音转换
音频与语音处理
2018-11-13 v1 机器学习
声音
机器学习
摘要
本文描述了一种基于带注意力和上下文保持机制的序列到序列学习(Seq2Seq)的语音转换(VC)任务方法。Seq2Seq 在语音合成与识别、机器翻译和图像字幕等涉及序列建模的众多任务中表现卓越。与当前 VC 技术相比,我们的方法 1)通过考虑引导注意力和提出的上下文保持损失,稳定并加速训练过程;2)不仅允许谱包络,还允许基频轮廓和语音时长被转换;3)不需要音素标签等上下文信息;4)不需要提前准备时间对齐的源和目标语音数据。在我们的实验中,所提出的 VC 框架仅使用一块 NVIDIA Tesla K80 GPU 便可在一天内完成训练,而合成语音的质量高于基于高斯混合模型的 VC 所转换的语音,并与基于循环神经网络的文本到语音合成生成的语音相当,后者可视为 VC 性能的上限。
引用
@article{arxiv.1811.04076,
title = {AttS2S-VC: Sequence-to-Sequence Voice Conversion with Attention and Context Preservation Mechanisms},
author = {Kou Tanaka and Hirokazu Kameoka and Takuhiro Kaneko and Nobukatsu Hojo},
journal= {arXiv preprint arXiv:1811.04076},
year = {2018}
}
备注
Submitted to ICASSP2019