用于神经转导器无监督微调与自训练的多假设 RNN-T 损失
计算与语言
2022-08-01 v1 声音
音频与语音处理
摘要
本文提出一种新方法,利用无标签语音数据对循环神经网络(RNN)-Transducer(RNN-T)端到端(E2E)自动语音识别(ASR)系统执行无监督微调与自训练。常规系统在使用无标签音频数据时以 ASR 假设作为目标进行微调/自训练,且易受基模型 ASR 性能影响。此处为减轻使用无标签数据时 ASR 错误的影响,我们提出一种多假设 RNN-T 损失,将多个 ASR 1-best 假设纳入损失函数。对于微调任务,Librispeech 上的 ASR 实验表明,与单假设方法相比,多假设方法在 test_other 集上实现了 14.2% 的词错误率(WER)相对降低。对于自训练任务,ASR 模型使用来自 Wall Street Journal(WSJ)、Aurora-4 的监督数据以及 CHiME-4 真实噪声数据作为无标签数据进行训练。与单假设方法相比,多假设方法在 CHiME-4 单通道真实噪声评估集上产生了 3.3% 的 WER 相对降低。
引用
@article{arxiv.2207.14736,
title = {Multiple-hypothesis RNN-T Loss for Unsupervised Fine-tuning and Self-training of Neural Transducer},
author = {Cong-Thanh Do and Mohan Li and Rama Doddipatla},
journal= {arXiv preprint arXiv:2207.14736},
year = {2022}
}
备注
Accepted to Interspeech 2022