中文

KAME:提升实时语音到语音对话式 AI 中知识的串联架构

计算与语言 2026-05-26 v2 人工智能 音频与语音处理

摘要

实时语音到语音 (S2S) 模型在生成自然、低延迟的对话式响应方面表现出色,但常缺乏深入的知识和语义理解。相比之下,组合了自动语音识别、文本基准的大型语言模型 (LLM) 和文本到语音合成的级联系统,虽在知识表示方面优势明显,但因延迟高,往往破坏了自然交互的流畅性。本文提出一种新型混合架构,以弥合这两种范式之间的差距。我们的框架通过 S2S 变换器处理用户语音,以实现即时响应,同时将查询同时传递给强大的后端 LLM。随后,LLM 的文本响应被实时注入,以指导 S2S 模型的语音生成,从而在不承担级联系统全部延迟代价的前提下,将丰富的知识注入其输出。我们使用语音合成的 MT-Bench 基准进行评估,该基准包含多轮问答会话。结果表明,我们的方法在响应正确性方面显著优于基线 S2S 模型,接近级联系统的表现,而保持与基线相当的延迟。

关键词

引用

@article{arxiv.2510.02327,
  title  = {KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI},
  author = {So Kuroki and Yotaro Kubo and Takuya Akiba and Yujin Tang},
  journal= {arXiv preprint arXiv:2510.02327},
  year   = {2026}
}

备注

Published at IEEE ICASSP 2026