中文

通过多任务学习将 VAD 融入 ASR 系统

音频与语音处理 2022-10-03 v2 计算与语言 声音

摘要

当我们将端到端自动语音识别(E2E-ASR)系统用于实际应用时,通常需要语音活动检测(VAD)系统,以通过丢弃音频中的非语音部分来提升性能并降低计算成本。通常 ASR 与 VAD 系统彼此独立地训练与使用。本文提出一种将 VAD 融入 ASR 系统的新颖多任务学习(MTL)框架。所提系统在训练阶段联合学习 ASR 与 VAD。在 VAD 的辅助下,ASR 性能得以提升,因为其连接主义时序分类(CTC)损失函数可利用 VAD 对齐信息。在推理阶段,所提系统以低计算成本去除非语音部分,并以高鲁棒性识别语音部分。在分段语音数据上的实验结果表明,利用 VAD 信息后,所提方法在英语和汉语数据集上均优于基线 ASR 系统。在非分段语音数据上,我们发现该系统优于那些额外构建基于 GMM 或基于 DNN 的语音活动检测器的 ASR 系统。

关键词

引用

@article{arxiv.2103.01661,
  title  = {Incorporating VAD into ASR System by Multi-task Learning},
  author = {Meng Li and Xia Yan and Feng Lin},
  journal= {arXiv preprint arXiv:2103.01661},
  year   = {2022}
}

备注

5 pages, 2 figures