基于生成对抗网络预训练端到端语音识别的微调
音频与语音处理
2021-03-25 v1 计算与语言
声音
摘要
近来,使用生成对抗网络(GAN)对端到端(E2E)ASR系统进行对抗训练已在低资源ASR语料库上得到探索。GAN通过双人极小极大博弈帮助学习真实数据表示。然而,使用GAN框架以大型ASR语料库训练E2E ASR模型从未被探索过,因为这可能因高方差梯度更新而耗时过长并面临收敛问题。本文中,我们引入了一种利用GAN目标微调预训练ASR模型的新框架,其中ASR模型作为生成器,判别器试图区分ASR输出与真实数据。由于ASR模型已预训练,我们假设ASR模型输出(软分布向量)有助于从判别器获得更高分数,并在我们的GAN框架内使判别器任务更困难,进而在微调阶段提升ASR模型性能。此处,预训练ASR模型通过额外的对抗损失针对判别器进行对抗微调。在完整LibriSpeech数据集上的实验表明,我们提出的方法优于基线及常规基于GAN的对抗模型。
引用
@article{arxiv.2103.13329,
title = {Fine-tuning of Pre-trained End-to-end Speech Recognition with Generative Adversarial Networks},
author = {Md Akmal Haidar and Mehdi Rezagholizadeh},
journal= {arXiv preprint arXiv:2103.13329},
year = {2021}
}
备注
Accepted in ICASSP 2021 conference