中文

Ichigo:混合模态早期融合实时语音助手

计算与语言 2025-04-07 v3 声音 音频与语音处理

摘要

大型语言模型(LLMs)彻底改变了自然语言处理,但由于整合音频和文本模态的复杂性,它们在基于语音的任务中的应用仍然具有挑战性。本文介绍了Ichigo,一种混合模态模型,能够无缝处理交错排列的语音和文本序列。利用基于标记化的早期融合方法,Ichigo将语音量化为离散标记,并对语音和文本模态采用统一的基于Transformer的架构。该方法实现了跨模态的联合推理和生成,无需单独的适配器。我们提出了一套全面的训练方法,包括在多语言语音识别数据集上的预训练和在精心策划的指令数据集上的微调。Ichigo在语音问答基准测试中展示了最先进的性能,优于现有的开源语音语言模型,并达到了与级联系统相当的结果。值得注意的是,Ichigo生成第一个标记的延迟仅为111毫秒,远低于当前模型。我们的方法不仅推进了多模态AI领域的发展,也为较小的研究团队有效贡献于开源语音语言模型提供了框架。

关键词

引用

@article{arxiv.2410.15316,
  title  = {Ichigo: Mixed-Modal Early-Fusion Realtime Voice Assistant},
  author = {Alan Dao and Dinh Bach Vu and Huy Hoang Ha},
  journal= {arXiv preprint arXiv:2410.15316},
  year   = {2025}
}