中文

Koel-TTS:基于偏好对齐与无分类器引导的增强型 LLM 语音生成

声音 2025-07-24 v2 人工智能 机器学习 音频与语音处理

摘要

自回归语音标记生成模型虽能产生卓越的多样性和自然性,但固有的可控性不足,常导致幻觉和不符合条件输入的意外语音。我们引入 Koel-TTS,一个由增强型编码器-解码器 Transformer TTS 模型构成的套件,通过整合受自动语音识别和说话人验证模型指导的偏好对齐技术来解决上述挑战。此外,我们引入无分类器引导技术进一步提升合成语音对文本和参考说话人音频的遵循度。我们的实验表明,这些优化显著提升了合成语音的目标说话人相似度、可理解性和自然度。值得注意的是,Koel-TTS 直接将文本和上下文音频映射到声学标记上,尽管训练数据显著小于最新 TTS 模型,却在上述指标上实现了领先表现。音频样本和演示可在我们的网站上获取。

关键词

引用

@article{arxiv.2502.05236,
  title  = {Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance},
  author = {Shehzeen Hussain and Paarth Neekhara and Xuesong Yang and Edresson Casanova and Subhankar Ghosh and Mikyas T. Desta and Roy Fejgin and Rafael Valle and Jason Li},
  journal= {arXiv preprint arXiv:2502.05236},
  year   = {2025}
}