具有来自未知说话人并行韵律迁移的神经 TTS 系统
音频与语音处理
2023-09-21 v1
摘要
现代神经 TTS 系统在提供充足训练数据时,能够生成自然且富有表现力的语音。此类系统可配备韵律控制功能,从而在推理时更直接地塑造语音输出。在某些 TTS 应用中,可能希望提供一种选项,以临时语音录音样本引导 TTS 系统,为特定输入提示施加隐式细粒度、用户偏好的韵律实现。本工作中,我们提出一种首创的神经 TTS 系统,配备此类功能,可从未知说话人的并行文本录音迁移韵律。我们证明,所提系统能将新说话人的语音韵律精确迁移至多种已训练 TTS 音色且不造成质量下降,同时保留目标 TTS 说话人身份,这由一组主观听感实验评估证实。
引用
@article{arxiv.2309.11487,
title = {A Neural TTS System with Parallel Prosody Transfer from Unseen Speakers},
author = {Slava Shechtman and Raul Fernandez},
journal= {arXiv preprint arXiv:2309.11487},
year = {2023}
}
备注
Presented at Interspeech 2023