中文

Speech ReaLLM —— 通过教导时间流动实现的实时流式语音识别

计算与语言 2024-06-17 v1 人工智能 声音 音频与语音处理

摘要

我们提出 Speech ReaLLM,这是一种新的语音识别架构,将“仅解码器”语音识别与 RNN-T 结合起来,使多模态 LLM 架构能够实现实时流式。这是首个专为处理连续音频而设计的“仅解码器”语音识别架构,无需显式端点检测。Speech ReaLLM 是更一般的 ReaLLM(“实时 LLM”)方法的一个特例,本文首次介绍该方法。灵感来源于 RNN-T:而非在用户提示结束时才生成响应,在每收到一个输入 token 时(通常为空)即可生成。在 Librispeech“test”数据集上,80M 参数的 Speech ReaLLM 实现了 3.0% 和 7.4% 的实时字词错误率(WER),无需外部语言模型或辅助损失。这仅略高于 3 倍更大规模的 Attention-Encoder-Decoder 基线。我们还展示了这种方法下,LLM 架构能够学习表示和再现时间的流动;并且预训练的 7B 参数 LLM 可被微调在此任务上取得相当好的效果。

关键词

引用

@article{arxiv.2406.09569,
  title  = {Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time},
  author = {Frank Seide and Morrie Doulaty and Yangyang Shi and Yashesh Gaur and Junteng Jia and Chunyang Wu},
  journal= {arXiv preprint arXiv:2406.09569},
  year   = {2024}
}