中文

连续语音令牌使大语言模型成为鲁棒的多模态学习器

声音 2024-12-09 v1 音频与语音处理 信号处理

摘要

最近类GPT-4o的多模态模型取得了显著进展,实现了直接的语音对语音对话,具备实时语音交互体验和强大的语音理解能力。然而,当前研究聚焦于离散语音令牌以与离散文本令牌对齐进行语言建模,这依赖于具有残差连接或独立分组令牌的音频编解码器;此类编解码器通常利用大规模多样化数据集训练,以确保离散语音编码对不同领域、噪声、风格的数据重建具有良好的表示,以及设计良好的编解码器量化器和编码器-解码器架构用于离散令牌语言建模。本文提出Flow-Omni,一个基于连续语音令牌的类GPT-4o模型,具备实时语音交互能力和低流式延迟。具体而言,首先,我们结合流匹配损失与预训练的自回归大语言模型和一个小型多层感知器网络来预测从语音提示中连续值语音令牌的概率分布,而不仅限于交叉熵损失。其次,我们将连续语音令牌融入Flow-Omni的多模态训练,从而实现了离散文本令牌和连续语音令牌共同作用下的鲁棒语音对语音性能。实验表明,与离散文本和语音多模态训练及其变体相比,连续语音令牌通过避免离散语音编码对LLM的固有表示损失缺陷,缓解了鲁棒性问题。

关键词

引用

@article{arxiv.2412.04917,
  title  = {Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners},
  author = {Ze Yuan and Yanqing Liu and Shujie Liu and Sheng Zhao},
  journal= {arXiv preprint arXiv:2412.04917},
  year   = {2024}
}