中文

Style-Talker:微调音频语言模型与风格基文本语音模型以实现快速语音对话生成

计算与语言 2024-08-23 v1 人工智能 音频与语音处理

摘要

大型语言模型(LLM)的快速发展显著推动了基于文本的聊天机器人开发,展示了其在连贯且情境相关的对话中所能实现的能力。然而,将这些进展延伸至实现端到端语音到语音对话机器人仍是一个巨大的挑战,主要由于需要大量数据和计算资源。传统方法是对自动语音识别(ASR)、LLM 和文本语音合成(TTS)模型进行级联处理,虽然有效,但因缺乏输入音频及其转录文本与输出音频之间的直接交互,导致语调不自然。这些系统也受限于 ASR 过程固有的延迟,难以用于实时应用。本文提出了 Style-Talker,一种创新的框架,通过微调音频 LLM 和风格基 TTS 模型实现快速语音对话生成。Style-Talker 接收用户输入音频,并使用转录的聊天历史和语音风格来生成响应的说话风格和文本。随后,TTS 模型合成语音并播放给用户。当响应语音播放时,输入语音 undergoes ASR 处理,以提取转录文本和说话风格,作为后续对话轮次的上下文。这种新型管道加速了传统的级联 ASR-LLM-TTS 系统,同时整合了来自输入语音的丰富副语言信息。我们的实验结果表明,Style-Talker 在对话自然性和连贯性方面显著优于传统级联和语音到语音基线模型,速度快过 50% 以上。

关键词

引用

@article{arxiv.2408.11849,
  title  = {Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation},
  author = {Yinghao Aaron Li and Xilin Jiang and Jordan Darefsky and Ge Zhu and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2408.11849},
  year   = {2024}
}

备注

CoLM 2024