中文

WavChat:口语对话模型概览

音频与语音处理 2024-11-27 v2 计算与语言 机器学习 多媒体 声音

摘要

近期,以 GPT-4o 等为代表的口语对话模型在语音领域引起了广泛关注。与传统三级级联式口语对话模型(由语音识别 ASR、大语言模型 LLM 和文本转语音 TTS 组成)相比,现代口语对话模型具有更强的智能性。这类先进的口语对话模型不仅理解音频、音乐及其他语音相关特征,还能捕捉语音中的风格和音色特征。此外,它们能够以低延迟生成高质量的多轮语音响应,实现通过同时听写和说话能力的实时交互。尽管口语对话系统取得了显著进展,但缺乏系统性地组织和分析这些系统及其底层技术的综合性综述。为此,我们首先按时间顺序收集现有的口语对话系统,并将其划分为级联式和端到端两大范式。随后,我们深入概述了口语对话模型的核心技术,涵盖语音表示、训练范式、流式处理、双工模式及交互能力等方面。每个章节讨论这些技术的局限性,并阐述未来研究的考量。此外,我们从训练和评估口语对话系统的角度,全面回顾了相关数据集、评估指标和基准测试。我们希望本综述有助于推动口语对话系统领域的学术研究和工业应用。相关材料已公开于 https://github.com/jishengpeng/WavChat。

关键词

引用

@article{arxiv.2411.13577,
  title  = {WavChat: A Survey of Spoken Dialogue Models},
  author = {Shengpeng Ji and Yifu Chen and Minghui Fang and Jialong Zuo and Jingyu Lu and Hanting Wang and Ziyue Jiang and Long Zhou and Shujie Liu and Xize Cheng and Xiaoda Yang and Zehan Wang and Qian Yang and Jian Li and Yidi Jiang and Jingzhen He and Yunfei Chu and Jin Xu and Zhou Zhao},
  journal= {arXiv preprint arXiv:2411.13577},
  year   = {2024}
}

备注

60 papes, working in progress