中文

IntrinsicVoice:赋予大语言模型内在实时语音交互能力

声音 2024-10-15 v2 人工智能

摘要

当前构建具备语音交互能力的大语言模型方法依赖于在语音响应生成之前或期间进行显式文本自回归生成,以维持内容质量,这不幸带来计算开销并增加多轮交互中的延迟。为此,我们引入IntrinsicVoice,一种具备内在实时语音交互能力的大语言模型。IntrinsicVoice旨�通过减轻文本与语音之间的模态差距,促进预训练大语言模型文本能力向语音模态的转化。我们的新颖架构GroupFormer能够将语音序列压缩至与文本序列相当的长度,同时生成高质量音频,显著缩短语音与文本之间的长度差,加快推理速度,缓解长文本建模问题。此外,我们构建了一个名为method-500k的多轮语音到语音对话数据集,包含近50万轮语音到语音对话,并采用跨模态训练策略以增强语音与文本之间的语义对齐。实验结果表明,IntrinsicVoice在多轮对话场景下能够以低于100ms的延迟生成高质量语音响应。演示可在https://instrinsicvoice.github.io/查看。

关键词

引用

@article{arxiv.2410.08035,
  title  = {IntrinsicVoice: Empowering LLMs with Intrinsic Real-time Voice Interaction Abilities},
  author = {Xin Zhang and Xiang Lyu and Zhihao Du and Qian Chen and Dong Zhang and Hangrui Hu and Chaohong Tan and Tianyu Zhao and Yuxuan Wang and Bin Zhang and Heng Lu and Yaqian Zhou and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2410.08035},
  year   = {2024}
}