Moshi:用于实时对话的语音-文本基础模型
人机交互
2024-10-02 v1 人工智能
音频与语音处理
摘要
我们介绍 Moshi,一种语音-文本基础模型和全双工 spoken dialogue 框架。当前的 spoken dialogue 系统依赖于独立组件的管道,即语音活动检测、语音识别、文本对话和文本转语音。此类框架无法模拟真实对话的体验。首先,其复杂性导致交互之间存在数秒延迟。其次,作为对话中间模态的文本会丢失影响意义的非语言信息——如情感或非语音声音。最后,它们依赖于说话者轮次的分割,这并未考虑重叠语音、中断和感叹词。Moshi 通过将 spoken dialogue 作为语音到语音生成来解决上述独立问题。从文本语言模型主干开始,Moshi 生成来自神经音频编解码器残余量化器的语音标记,同时分别建模其自身语音和用户语音到并行流。这允许消除显式说话者轮次,并建模任意对话动态。我们进一步扩展了前述工作的层次语义到声学标记生成,首先预测与音频标记时间对齐的文本标记作为前缀。不仅此“内独白”方法显著提高了生成语音的语言质量,我们还展示了它如何提供流式语音识别和文本转语音。我们的模型是首个实时全双工 spoken large language model,实际延迟为 200ms(理论延迟 160ms),可在 https://github.com/kyutai-labs/moshi 查看。
引用
@article{arxiv.2410.00036,
title = {InsightPulse: An IoT-based System for User Experience Interview Analysis},
author = {Dian Lyu and Yuetong Lu and Jassie He and Murad Mehrab Abrar and Ruijun Xie and John Raiti},
journal= {arXiv preprint arXiv:2410.00036},
year = {2024}
}
备注
Accepted for publication at the 10th IEEE International Conference on Collaboration and Internet Computing (IEEE CIC 2024), Washington D.C., USA