Llama-VITS:利用语义感知增强TTS合成
计算与语言
2024-04-19 v3 声音
音频与语音处理
摘要
自然语言处理(NLP)的最新进展表明,大型语言模型(LLM)擅长为各种目的生成高质量文本。值得注意的是,在文本转语音(TTS)系统中,集成BERT进行语义Token生成凸显了语义内容在产生连贯语音输出中的重要性。尽管如此,LLM在增强TTS合成方面的具体效用仍然相当有限。本研究引入了一种创新方法Llama-VITS,它通过使用LLM丰富文本的语义内容来增强TTS合成。Llama-VITS将来自Llama2的语义嵌入与领先的端到端TTS框架VITS模型相结合。通过在LJSpeech数据集(一个包含大量中性、清晰语音的数据集)上的实验,我们证明了Llama-VITS利用Llama2进行主要语音合成过程,其自然度与原始VITS(ORI-VITS)以及结合BERT的VITS(BERT-VITS)相匹配。此外,我们的方法在EmoV_DB_bea_sem数据集(从EmoV_DB数据集中精选的情感一致的语音)上显著增强了情感表现力,突显了其生成情感语音的潜力。
关键词
引用
@article{arxiv.2404.06714,
title = {Llama-VITS: Enhancing TTS Synthesis with Semantic Awareness},
author = {Xincan Feng and Akifumi Yoshimoto},
journal= {arXiv preprint arXiv:2404.06714},
year = {2024}
}
备注
9 pages, 2 figures, 4 tables; accepted at LREC-COLING 2024