中文

SAN:一种鲁棒的端到端自动语音识别模型架构

声音 2022-10-28 v1 计算与语言 音频与语音处理

摘要

本文提出了一种用于自动语音识别的新型孪生对抗网络(SAN)架构,旨在解决模糊音频识别的难题。具体而言,SAN 构建了两个子网络来区分音频特征输入,然后引入一个损失函数来统一这些子网络的输出分布。对抗学习使网络能够捕获更本质的声学特征,并帮助模型在遇到模糊音频输入时取得更好的性能。我们在多个数据集上对 SAN 模型进行了自动语音识别任务的数值实验。所有实验结果表明,孪生对抗网络显著降低了字符错误率(CER)。具体来说,我们在 AISHELL-1 数据集上,在不使用语言模型的情况下,达到了 4.37 的最新 CER,这带来了约 5% 的相对 CER 降低。为了揭示孪生对抗网络的通用性,我们还进行了音素识别任务的实验,结果同样显示了孪生对抗网络的优越性。

关键词

引用

@article{arxiv.2210.15285,
  title  = {SAN: a robust end-to-end ASR model architecture},
  author = {Zeping Min and Qian Ge and Guanhua Huang},
  journal= {arXiv preprint arXiv:2210.15285},
  year   = {2022}
}