基于音频前缀低秩适配的语言模型的推测语音识别
音频与语音处理
2024-07-08 v1 计算与语言
摘要
本文探讨了推测语音识别(SSR),即通过赋予常规自动语音识别(ASR)推测能力,使其在音频到来前即可提前运行。我们提出了衡量 SSR 性能的指标,并提出一种模型通过结合 RNN-Transducer 基于的 ASR 系统和音频前缀语言模型(LM)来实现 SSR。ASR 系统对ongoing 音频进行转录,并将所得转录文本(along with 音频相关的前缀)输入 LM,后者对转录的可能完成情况进行推测。我们在各种 ASR 数据集上进行实验,展示了该方法的有效性以及 SSR 作为降低 ASR 延迟的方法的可行性。
引用
@article{arxiv.2407.04641,
title = {Speculative Speech Recognition by Audio-Prefixed Low-Rank Adaptation of Language Models},
author = {Bolaji Yusuf and Murali Karthick Baskar and Andrew Rosenberg and Bhuvana Ramabhadran},
journal= {arXiv preprint arXiv:2407.04641},
year = {2024}
}
备注
Interspeech 2024