中文

Llama-VITS:利用语义感知增强TTS合成

计算与语言 2024-04-19 v3 声音 音频与语音处理

摘要

自然语言处理(NLP)的最新进展表明,大型语言模型(LLM)擅长为各种目的生成高质量文本。值得注意的是,在文本转语音(TTS)系统中,集成BERT进行语义Token生成凸显了语义内容在产生连贯语音输出中的重要性。尽管如此,LLM在增强TTS合成方面的具体效用仍然相当有限。本研究引入了一种创新方法Llama-VITS,它通过使用LLM丰富文本的语义内容来增强TTS合成。Llama-VITS将来自Llama2的语义嵌入与领先的端到端TTS框架VITS模型相结合。通过在LJSpeech数据集(一个包含大量中性、清晰语音的数据集)上的实验,我们证明了Llama-VITS利用Llama2进行主要语音合成过程,其自然度与原始VITS(ORI-VITS)以及结合BERT的VITS(BERT-VITS)相匹配。此外,我们的方法在EmoV_DB_bea_sem数据集(从EmoV_DB数据集中精选的情感一致的语音)上显著增强了情感表现力,突显了其生成情感语音的潜力。

关键词

引用

@article{arxiv.2404.06714,
  title  = {Llama-VITS: Enhancing TTS Synthesis with Semantic Awareness},
  author = {Xincan Feng and Akifumi Yoshimoto},
  journal= {arXiv preprint arXiv:2404.06714},
  year   = {2024}
}

备注

9 pages, 2 figures, 4 tables; accepted at LREC-COLING 2024