一种用于语音识别的带时空丢弃的CTC触发孪生网络
音频与语音处理
2022-06-23 v2
摘要
孪生网络在无监督视觉表示学习中已显示出有效结果。这些模型旨在通过最大化同一输入的两个增广间的相似性来学习不变表示。本文中,我们提出一种有效的孪生网络以提升端到端自动语音识别(ASR)的鲁棒性。我们引入时空丢弃,以对孪生—ASR框架支持更剧烈的扰动。此外,我们还放宽了相似性正则化,以最大化连接主义时序分类(CTC)脉冲出现帧上的分布相似性,而非所有帧上的分布相似性。所提架构的效率在两个基准AISHELL-1和Librispeech上得到评估,分别带来7.13%和6.59%的相对字符错误率(CER)与词错误率(WER)下降。分析表明,我们提出的方法为训练模型带来了更好的均匀性,并明显增大了CTC脉冲。
引用
@article{arxiv.2206.08031,
title = {A CTC Triggered Siamese Network with Spatial-Temporal Dropout for Speech Recognition},
author = {Yingying Gao and Junlan Feng and Tianrui Wang and Chao Deng and Shilei Zhang},
journal= {arXiv preprint arXiv:2206.08031},
year = {2022}
}