中文

SLAM-Omni: 基于单阶段训练的时长可控语音交互系统

音频与语音处理 2024-12-23 v1

摘要

近期进展凸显了端到端实时 spoken dialogue 系统的潜力,展现出低延迟和高质量。本文引入 SLAM-Omni,一个时长可控、单阶段训练的语音交互系统。SLAM-Omni 通过建模spoken language 的语义 token 并将说话人信息解耦到声码器,实现零-shot 时长控制。我们在每个步骤预测分组的 speech 语义 token,显著缩短音频 token 的序列长度,加速训练和推理。此外,我们提出历史文本提示以压缩对话历史,实现高效的多轮交互。全面评估表明,SLAM-Omni 在规模相似的先前模型基础上性能更优,仅需 15 小时的训练即可在 4 块 GPU 上完成,数据有限。值得注意的是,这是首个实现单阶段训练方法即可达到竞争性能的 spoken dialogue 系统,无需在 TTS 或 ASR 任务上进行预训练。进一步实验在更大数据集上验证了其多语言和多轮对话能力。

关键词

引用

@article{arxiv.2412.15649,
  title  = {SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training},
  author = {Wenxi Chen and Ziyang Ma and Ruiqi Yan and Yuzhe Liang and Xiquan Li and Ruiyang Xu and Zhikang Niu and Yanqiao Zhu and Yifan Yang and Zhanxun Liu and Kai Yu and Yuxuan Hu and Jinyu Li and Yan Lu and Shujie Liu and Xie Chen},
  journal= {arXiv preprint arXiv:2412.15649},
  year   = {2024}
}