序列到序列语音合成中带插话语气的对话式说话风格迁移
音频与语音处理
2022-07-26 v1 声音
摘要
序列到序列文本到语音架构在提供充足训练数据的情况下,能够直接从音素序列生成低层声学特征,并生成自然且富有表现力的语音。此类系统可以在多风格多说话人设置下,将期望的说话风格从某个已见说话人学习并迁移到另一说话人,这对于创建可扩展且可定制的人机交互系统极为重要。在这项工作中,我们探索了从一个具有风格细微差别和插语的专用单说话人对话语料库进行一对多风格迁移。我们详细阐述了语料库设计,并探讨了在基于语音转换的数据增强辅助下此类风格迁移的可行性。在一组主观听感实验中,该方法实现了高保真风格迁移且无质量退化。然而,观察到了一定的说话人音色偏移,需要在语音转换方面进一步改进。
引用
@article{arxiv.2207.12262,
title = {Transplantation of Conversational Speaking Style with Interjections in Sequence-to-Sequence Speech Synthesis},
author = {Raul Fernandez and David Haws and Guy Lorberbom and Slava Shechtman and Alexander Sorin},
journal= {arXiv preprint arXiv:2207.12262},
year = {2022}
}
备注
Accepted for presentation at Interspeech 2022