基于多假设 CTC 的端到端语音识别半监督自适应
计算与语言
2021-04-01 v2
摘要
本文提出一种端到端语音识别的自适应方法。该方法将多个自动语音识别(ASR)的 1-best 假设集成到连接主义时序分类(CTC)损失函数的计算中。当使用 ASR 假设时,多个 ASR 假设的集成有助于减轻 ASR 假设中的错误对 CTC 损失计算的影响。在部分自适应数据无标签的半监督自适应场景中应用该方法时,所提方法的 CTC 损失由对无标签自适应数据进行解码所得的不同 ASR 1-best 假设计算而来。实验在干净与多条件训练场景下开展,其中基于 CTC 的端到端 ASR 系统分别在 Wall Street Journal (WSJ) 干净训练数据与 CHiME-4 多条件训练数据上训练,并在 Aurora-4 测试数据上测试。与仅使用带人工转写的部分自适应数据通过反向传播微调的基线系统相比,所提自适应方法在干净与多条件训练场景下分别取得了 6.6% 和 5.8% 的相对词错误率(WER)降低。
引用
@article{arxiv.2103.15515,
title = {Multiple-hypothesis CTC-based semi-supervised adaptation of end-to-end speech recognition},
author = {Cong-Thanh Do and Rama Doddipatla and Thomas Hain},
journal= {arXiv preprint arXiv:2103.15515},
year = {2021}
}
备注
Accepted at ICASSP 2021