关于基于注意力的端到端语音识别在独立与重打分模式下编码器的比较
声音
2022-08-26 v1 计算与语言
机器学习
音频与语音处理
摘要
流式自动语音识别(ASR)模型更受欢迎且适用于基于语音的应用。然而,非流式模型因能观测整个音频上下文而提供更好的性能。为了在诸如语音搜索等流式应用中利用非流式模型的优势,其通常以第二遍重打分模式使用。利用流式模型生成的候选假设由非流式模型重新打分。在这项工作中,我们在 Flipkart 语音搜索任务上评估非流式基于注意力的端到端 ASR 模型在独立与重打分两种模式下的表现。这些模型基于 Listen-Attend-Spell(LAS)编码器-解码器架构。我们基于 LSTM、Transformer 和 Conformer 实验了不同的编码器变体。我们比较了这些模型的延迟需求及其性能。总体而言,我们表明 Transformer 模型以最低延迟需求提供了可接受的 WER。我们报告了使用第二遍 LAS 重打分相对 WER 提升约 16%,且延迟开销低于 5ms。我们也强调了 CNN 前端与 Transformer 架构相结合以实现可比词错误率(WER)的重要性。此外,我们观察到在第二遍重打分模式下所有编码器提供相似的收益,而在独立文本生成模式下性能差异显著。
引用
@article{arxiv.2206.12829,
title = {On Comparison of Encoders for Attention based End to End Speech Recognition in Standalone and Rescoring Mode},
author = {Raviraj Joshi and Subodh Kumar},
journal= {arXiv preprint arXiv:2206.12829},
year = {2022}
}
备注
Accepted at SPCOM 2022