中文

面向未分段录音的无 VAD 流式混合 CTC/注意力 ASR

音频与语音处理 2021-07-16 v1 计算与语言 声音

摘要

本工作中,我们提出新颖的解码算法,基于带辅助连接主义时序分类(CTC)目标的单调分块注意力(MoChA),实现在无语音活动检测(VAD)的未分段长时录音上的流式自动语音识别(ASR)。我们提出一种块同步束搜索解码,以利用高效的批处理输出同步与低延迟输入同步搜索。我们还提出一种无 VAD 推理算法,借助 CTC 概率确定重置模型状态的合适时机,从而应对长时数据的脆弱性。实验评估表明,块同步解码取得了与标签同步解码相当的精度。此外,无 VAD 推理可鲁棒识别长达数小时的长时语音。

关键词

引用

@article{arxiv.2107.07509,
  title  = {VAD-free Streaming Hybrid CTC/Attention ASR for Unsegmented Recording},
  author = {Hirofumi Inaguma and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2107.07509},
  year   = {2021}
}

备注

Accepted at Interspeech 2021