中文

Moonshine:面向实时转录与语音指令的语音识别

声音 2024-10-23 v2 计算与语言 机器学习 音频与语音处理

摘要

本文介绍 Moonshine,一个为实时转录和语音指令处理优化的语音识别模型系列。Moonshine 基于编码器-解码器 Transformer 架构,采用旋转位置编码 (RoPE) 代替传统的绝对位置编码。该模型在各种长度的语音片段上进行训练,但不使用零填充,这在推理时使编码器更高效。与 OpenAI 的 Whisper tiny-en 进行基准测试后,Moonshine Tiny 在转录 10 秒语音片段时计算需求降低 5 倍,且在标准评估数据集上未增加单词错误率。这些结果凸显了 Moonshine 在实时和资源受限应用中的潜力。

关键词

引用

@article{arxiv.2410.15608,
  title  = {Moonshine: Speech Recognition for Live Transcription and Voice Commands},
  author = {Nat Jeffries and Evan King and Manjunath Kudlur and Guy Nicholson and James Wang and Pete Warden},
  journal= {arXiv preprint arXiv:2410.15608},
  year   = {2024}
}

备注

7 pages, 6 figures, 3 tables