E2E Segmenter:面向长语音识别的联合分割与解码器
声音
2022-06-16 v2 计算与语言
机器学习
音频与语音处理
摘要
提升端到端 ASR 模型在数分钟至数小时长 utterance 上的性能是语音识别中持续的挑战。一种常见方案是预先使用独立的语音活动检测器(VAD)对音频进行分割,该检测器仅基于声学语音/非语音信息决定分割边界位置。然而,VAD 分割器对于真实语音可能非最优,例如一个本应作为整体看待的完整句子可能在中间包含犹豫("set an alarm for... 5 o'clock")。我们提出以端到端 ASR 模型替代 VAD,该模型能够以流式方式预测分割边界,使得分割决策不仅可基于更好的声学特征,还可基于解码文本中的语义特征,且额外计算开销可忽略。在时长最长达 30 分钟的真实长语音(YouTube)实验中,相较于最先进的 Conformer RNN-T 模型上的 VAD 分割器基线,我们取得了 8.5% 的相对 WER 提升以及中位段末延迟减少 250 ms。
引用
@article{arxiv.2204.10749,
title = {E2E Segmenter: Joint Segmenting and Decoding for Long-Form ASR},
author = {W. Ronny Huang and Shuo-yiin Chang and David Rybach and Rohit Prabhavalkar and Tara N. Sainath and Cyril Allauzen and Cal Peyser and Zhiyun Lu},
journal= {arXiv preprint arXiv:2204.10749},
year = {2022}
}
备注
Interspeech 2022