中文

用于低延迟流式ASR的延迟惩罚Transducer

音频与语音处理 2022-11-02 v1 计算与语言 机器学习 声音

摘要

在流式自动语音识别(ASR)中,期望尽可能降低延迟,同时对识别准确率影响最小。尽管一些现有方法能够实现此目标,但由于依赖外部对齐,它们难以实现。在本文中,我们提出了一种在transducer模型中惩罚符号延迟的简单方法,从而无需外部对齐即可平衡流式模型的符号延迟与准确率之间的权衡。具体而言,我们的方法将一个小的常数乘以 (T/2 - t)(其中T为帧数,t为当前帧)加到所有被送入二维transducer递归的非空白对数概率(归一化后)上。对于流式Conformer模型和单向长短期记忆(LSTM)模型,实验结果表明它能在可接受的性能退化下显著降低符号延迟。我们的方法实现了与先前发表的FastEmit相似的延迟-准确率权衡,但我们认为我们的方法更优,因为它有更好的依据:它等价于惩罚平均符号延迟。我们的工作已开源并公开可用(https://github.com/k2-fsa/k2)。

关键词

引用

@article{arxiv.2211.00490,
  title  = {Delay-penalized transducer for low-latency streaming ASR},
  author = {Wei Kang and Zengwei Yao and Fangjun Kuang and Liyong Guo and Xiaoyu Yang and Long lin and Piotr Żelasko and Daniel Povey},
  journal= {arXiv preprint arXiv:2211.00490},
  year   = {2022}
}

备注

Submitted to 2023 IEEE International Conference on Acoustics, Speech and Signal Processing