中文

大语言模型时代下的可控语音合成:一项系统性综述

计算与语言 2025-08-26 v3 人工智能 机器学习 多媒体 声音 音频与语音处理

摘要

文本转语音(TTS)已从生成自然语音发展到实现对情感、音色和风格等属性的细粒度控制。受工业需求增长和深度学习突破的驱动,例如扩散模型和大语言模型(LLMs),可控TTS已成为一个快速发展的研究领域。本综述首次对可控TTS方法进行了全面回顾,从传统控制技术到使用自然语言提示的新兴方法。我们对模型架构、控制策略和特征表示进行分类,同时也总结了可控TTS中的挑战、数据集和评估。本综述旨在通过提供清晰的分类法和突出该快速演进领域的未来方向来指导研究人员和实践者。可访问 https://github.com/imxtx/awesome-controllabe-speech-synthesis 获取完整的论文列表和更新。

关键词

引用

@article{arxiv.2412.06602,
  title  = {Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey},
  author = {Tianxin Xie and Yan Rong and Pengfei Zhang and Wenwu Wang and Li Liu},
  journal= {arXiv preprint arXiv:2412.06602},
  year   = {2025}
}

备注

The first comprehensive survey on controllable TTS. Accepted to the EMNLP 2025 main conference