基于音高偏移数据增强与非平行语音转换的低资源文本转语音跨说话人情感迁移
音频与语音处理
2022-07-06 v2 机器学习
声音
信号处理
摘要
通过语音转换(VC)进行的数据增强已成功应用于低资源表现型文本转语音(TTS),当目标说话人仅有中性数据可用时。尽管 VC 的质量对此方法至关重要,但学习稳定的 VC 模型具有挑战性,因为低资源场景下数据量有限,且高表现力语音具有较大的声学多样性。为解决该问题,我们提出了一种结合音高偏移与 VC 技术的新型数据增强方法。由于音高偏移数据增强能够覆盖多种音高动态,即使目标说话人仅有 1000 句中性数据可用,它也能极大地稳定 VC 与 TTS 模型的训练。主观测试结果表明,基于 FastSpeech 2 的情感 TTS 系统采用所提方法后,相较于传统方法在自然度与情感相似度上均有提升。
引用
@article{arxiv.2204.10020,
title = {Cross-Speaker Emotion Transfer for Low-Resource Text-to-Speech Using Non-Parallel Voice Conversion with Pitch-Shift Data Augmentation},
author = {Ryo Terashima and Ryuichi Yamamoto and Eunwoo Song and Yuma Shirahata and Hyun-Wook Yoon and Jae-Min Kim and Kentaro Tachibana},
journal= {arXiv preprint arXiv:2204.10020},
year = {2022}
}
备注
Accepted to INTERSPEECH 2022