中文

利用多模态上下文和大语言模型改进基于音频编解码器的零样图文本到语音合成

声音 2024-06-07 v1 计算与语言 音频与语音处理

摘要

近期大语言模型(LLM)的进展和音频编解码器的发展极大推动了零样图TTS。它们仅需3秒未见说话人语音即可作为声学提示,实现个性化语音合成。然而,仅支持短语音提示,无法利用如有声书和对话式TTS场景所需的更长上下文信息。本文提出一种新型音频编解码器-based TTS模型,通过多种增强措施适应上下文特征。灵感来自Qformer,我们提出一种多模态上下文增强Qformer(MMCE-Qformer),以利用额外的多模态上下文信息。此外,我们采用预训练的LLM来利用其理解能力预测语义标记,并使用SoundStorm生成声学标记,从而提升音频质量和说话人相似度。广泛的客观和主观评估表明,我们的方法在各种上下文TTS场景中优于基线方法。

关键词

引用

@article{arxiv.2406.03706,
  title  = {Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model},
  author = {Jinlong Xue and Yayue Deng and Yicheng Han and Yingming Gao and Ya Li},
  journal= {arXiv preprint arXiv:2406.03706},
  year   = {2024}
}

备注

Accepted by Interspeech 2024