利用自对齐降低流式 ASR 模型延迟
音频与语音处理
2021-05-12 v1 人工智能
计算与语言
声音
摘要
在性能回归最小的前提下降低流式端到端 ASR 模型的预测延迟是一个具有挑战性的问题。约束对齐是一种众所周知的现有方法,它利用外部低延迟声学模型对预测的词语边界进行惩罚。相反,最近提出的 FastEmit 是一种序列级延迟正则化方案,在无任何参考对齐的情况下鼓励词汇标记而非空白。尽管所有这些方案在降低延迟方面均取得成功,但在应用这些延迟约束方案后 ASR 词错率(WER)往往严重退化。在本文中,我们提出一种名为自对齐的新型延迟约束方法。自对齐不需要外部对齐模型,而是利用训练模型的 Viterbi 强制对齐来寻找更低延迟的对齐方向。根据 LibriSpeech 评估,自对齐优于现有方案:在相似词错率下,相比 FastEmit 与约束对齐分别降低 25% 与 56% 的延迟。对于语音搜索评估,相比 FastEmit 与约束对齐分别实现 12% 与 25% 的延迟降低,且词错率提升超过 2%。
引用
@article{arxiv.2105.05005,
title = {Reducing Streaming ASR Model Delay with Self Alignment},
author = {Jaeyoung Kim and Han Lu and Anshuman Tripathi and Qian Zhang and Hasim Sak},
journal= {arXiv preprint arXiv:2105.05005},
year = {2021}
}
备注
submitted to INTERSPEECH 2021