StyleFusion TTS:面向零样文本转语音的多模态风格控制与增强特征融合
音频与语音处理
2024-09-25 v1 声音
摘要
我们提出 StyleFusion-TTS,一个支持提示/音频参考、可控风格和说话人、面向零样文本转语音(TTS)的系统,旨在提升当前研究文献的可编辑性和自然性。我们提出一种通用前端编码器,作为紧凑且高效的模块,利用包括文本提示、音频参考和说话人声纹参考在内的多模态输入,以完全零样方式产生解耦风格和说话人控制嵌入。我们的方法还利用层次化 conformer 结构融合风格和说话人控制嵌入,以实现当前先进 TTS 架构中的最佳特征融合。StyleFusion-TTS 通过多种指标进行评估,包括主观和客观评估。该系统在我们的评估中表现出色,表明其在零样文本转语音领域具有潜力。
引用
@article{arxiv.2409.15741,
title = {StyleFusion TTS: Multimodal Style-control and Enhanced Feature Fusion for Zero-shot Text-to-speech Synthesis},
author = {Zhiyong Chen and Xinnuo Li and Zhiqi Ai and Shugong Xu},
journal= {arXiv preprint arXiv:2409.15741},
year = {2024}
}
备注
The 7th Chinese Conference on Pattern Recognition and Computer Vision PRCV 2024