构建用于流式语音搜索的准确低延迟 ASR 系统
声音
2023-05-31 v1 计算与语言
机器学习
音频与语音处理
摘要
自动语音识别(ASR)在基于语音的应用中起着关键作用。对于像语音搜索这样需要实时反馈的应用,流式能力变得至关重要。虽然基于 LSTM/RNN 和 CTC 的 ASR 系统常用于低延迟流式应用,但由于缺乏未来音频帧,它们通常比最先进模型准确率更低。在这项工作中,我们专注于为大规模 Hinglish(印地语和英语的混合)语音搜索开发准确的基于 LSTM、注意力和 CTC 的流式 ASR 模型。我们研究了 vanilla LSTM 训练中的各种修改,这些修改在保持流式能力的同时提升了系统准确率。我们还解决了流式应用中端语音(EOS)检测的关键需求。我们提出了一种用于端到端 CTC 模型的简单训练和推理策略,可实现联合 ASR 与 EOS 检测。我们的模型在 Flipkart 的语音搜索(每日处理约 600 万次查询的庞大流量)上的评估表明,相比 vanilla LSTM-CTC 模型有显著性能提升。我们的模型在无 EOS 时词错误率(WER)为 3.69%,有 EOS 时为 4.78%,同时与独立的语音活动检测(VAD)模型相比,搜索延迟减少了约 1300 毫秒(相当于 46.64% 的降低)。
引用
@article{arxiv.2305.18596,
title = {Building Accurate Low Latency ASR for Streaming Voice Search},
author = {Abhinav Goyal and Nikesh Garera},
journal= {arXiv preprint arXiv:2305.18596},
year = {2023}
}
备注
Accepted at ACL 2023 Industry Track