中文

混合模型提供的弱对齐监督改进端到端ASR

声音 2023-12-04 v2 计算与语言 音频与语音处理

摘要

本文旨在从现有混合系统中创建弱对齐监督,以辅助自动语音识别的端到端建模。为此,我们使用现有混合ASR系统生成训练音频的三音子对齐。随后利用所得对齐在编码器特定层上构建交叉熵损失。与通用独热交叉熵损失不同,此处我们使用带标签平滑参数的交叉熵损失来正则化该监督。作为对比,我们还使用独热交叉熵损失和带损失加权的CTC损失进行了实验。结果表明,在第三编码器层放置标签平滑参数为0.5的弱对齐监督优于另外两种方法,并在TED-LIUM 2数据集上相较基线取得约5%的相对词错率(WER)降低。在Tagalog端到端ASR系统上直接应用该方法时,我们观察到类似的改进。

关键词

引用

@article{arxiv.2311.14835,
  title  = {Weak Alignment Supervision from Hybrid Model Improves End-to-end ASR},
  author = {Jintao Jiang and Yingbo Gao and Zoltan Tuske},
  journal= {arXiv preprint arXiv:2311.14835},
  year   = {2023}
}

备注

7 pages, 7 figures, and 5 tables