面向未分段录音的无 VAD 流式混合 CTC/注意力 ASR
音频与语音处理
2021-07-16 v1 计算与语言
声音
摘要
本工作中,我们提出新颖的解码算法,基于带辅助连接主义时序分类(CTC)目标的单调分块注意力(MoChA),实现在无语音活动检测(VAD)的未分段长时录音上的流式自动语音识别(ASR)。我们提出一种块同步束搜索解码,以利用高效的批处理输出同步与低延迟输入同步搜索。我们还提出一种无 VAD 推理算法,借助 CTC 概率确定重置模型状态的合适时机,从而应对长时数据的脆弱性。实验评估表明,块同步解码取得了与标签同步解码相当的精度。此外,无 VAD 推理可鲁棒识别长达数小时的长时语音。
引用
@article{arxiv.2107.07509,
title = {VAD-free Streaming Hybrid CTC/Attention ASR for Unsegmented Recording},
author = {Hirofumi Inaguma and Tatsuya Kawahara},
journal= {arXiv preprint arXiv:2107.07509},
year = {2021}
}
备注
Accepted at Interspeech 2021