中文

集成基于CTC的语音活动检测的端到端自动语音识别

音频与语音处理 2020-03-16 v2 计算与语言 声音

摘要

本文将一个语音活动检测(VAD)功能与端到端自动语音识别相集成,以面向在线语音接口和转写极长的音频记录。我们聚焦于连接主义时序分类(CTC)及其CTC/注意力架构的扩展。与基于注意力的架构相反,可以基于带CTC(预)softmax输出的贪心搜索执行输入同步的标签预测。该预测包含连续的较长空白标签,可被视为非语音区域。我们使用这些标签作为线索,通过简单阈值化来检测语音段。阈值直接与非语音区域的长度相关,比传统的VAD超参数更直观且更易控制。在非分段数据上的实验结果表明,所提方法优于使用传统基于能量和基于神经网络的VAD方法的基线方法,并实现了小于0.2的RTF。所提方法已公开可用。

关键词

引用

@article{arxiv.2002.00551,
  title  = {End-to-End Automatic Speech Recognition Integrated With CTC-Based Voice Activity Detection},
  author = {Takenori Yoshimura and Tomoki Hayashi and Kazuya Takeda and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2002.00551},
  year   = {2020}
}

备注

Submitted to ICASSP 2020