中文

推进大语言模型在语音对话中捕捉多样说话风格并恰当响应

计算与语言 2024-05-31 v2 音频与语音处理

摘要

在语音对话中,即使两个当前轮次是相同的句子,当它们以不同的风格说出时,其响应可能仍然不同。说话风格包含副语言和韵律信息,标志着文本与语音模态之间最显著的差异。当使用纯文本 LLM 对语音对话进行建模时,纯文本 LLM 无法根据当前轮次的说话风格给出不同的响应。在本文中,我们专注于使 LLM 能够倾听说话风格并恰当响应。我们的目标是教会 LLM“即使句子相同,如果以不同的风格说出,其对应的响应也可能不同”。由于没有合适的数据集来实现这一目标,我们收集了一个语音到语音的数据集 StyleTalk,其具有以下期望特征:当两个当前语音具有相同的内容但以不同的风格说出时,它们的响应将是不同的。为了教会 LLM 理解说话风格并恰当响应,我们提出了 Spoken-LLM 框架,该框架能够对语言内容和说话风格进行建模。我们使用 StyleTalk 数据集训练 Spoken-LLM,并设计了两阶段训练流程以帮助 Spoken-LLM 更好地学习说话风格。基于大量实验,我们表明 Spoken-LLM 优于纯文本基线和先前的语音 LLM 方法。

关键词

引用

@article{arxiv.2402.12786,
  title  = {Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations},
  author = {Guan-Ting Lin and Cheng-Han Chiang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2402.12786},
  year   = {2024}
}

备注

Accepted by ACL 2024