中文

StyleFusion TTS:面向零样文本转语音的多模态风格控制与增强特征融合

音频与语音处理 2024-09-25 v1 声音

摘要

我们提出 StyleFusion-TTS,一个支持提示/音频参考、可控风格和说话人、面向零样文本转语音(TTS)的系统,旨在提升当前研究文献的可编辑性和自然性。我们提出一种通用前端编码器,作为紧凑且高效的模块,利用包括文本提示、音频参考和说话人声纹参考在内的多模态输入,以完全零样方式产生解耦风格和说话人控制嵌入。我们的方法还利用层次化 conformer 结构融合风格和说话人控制嵌入,以实现当前先进 TTS 架构中的最佳特征融合。StyleFusion-TTS 通过多种指标进行评估,包括主观和客观评估。该系统在我们的评估中表现出色,表明其在零样文本转语音领域具有潜力。

关键词

引用

@article{arxiv.2409.15741,
  title  = {StyleFusion TTS: Multimodal Style-control and Enhanced Feature Fusion for Zero-shot Text-to-speech Synthesis},
  author = {Zhiyong Chen and Xinnuo Li and Zhiqi Ai and Shugong Xu},
  journal= {arXiv preprint arXiv:2409.15741},
  year   = {2024}
}

备注

The 7th Chinese Conference on Pattern Recognition and Computer Vision PRCV 2024