中文

通过超 6 万小时合成语音对话数据扩展监督微调,推动语音语言模型发展

计算与语言 2024-12-04 v2 人工智能 人机交互

摘要

GPT-4o 代表了通过语音实现与大型语言模型(LLM)实时交互的重要里程碑,其卓越的低延迟和高流畅度不仅引人注目,也激发了该领域的研究兴趣。这种实时语音交互在需要快速反馈和即时响应的场景中尤为重要,显著提升了用户体验。然而,针对实时大型语音语言模型,尤其是中文领域的研究仍显不足。本文提出 KE-Omni,一个基于 Ke-SpeechChat 构建的无缝大型语音语言模型。Ke-SpeechChat 包括 700 万中英中文对话,涉及 42002 位说话人,总时长超过 6 万小时。这对该领域的研究与开发具有重要推进作用。演示可在 \url{https://huggingface.co/spaces/KE-Team/KE-Omni} 访问。

关键词

引用

@article{arxiv.2412.01078,
  title  = {Advancing Speech Language Models by Scaling Supervised Fine-Tuning with Over 60,000 Hours of Synthetic Speech Dialogue Data},
  author = {Shuaijiang Zhao and Tingwei Guo and Bajian Xiang and Tongtang Wan and Qiang Niu and Wei Zou and Xiangang Li},
  journal= {arXiv preprint arXiv:2412.01078},
  year   = {2024}
}

备注

KE-Omni, Ke-SpeechChat