使用可替换内部语言模型与残差 Softmax 的适配型端到端 ASR 模型
音频与语音处理
2023-03-16 v2 声音
摘要
端到端(E2E)自动语音识别(ASR)隐式学习配对音频-转录训练数据的词元序列分布。然而,它仍受从训练到测试的域偏移影响,且域适应仍具挑战性。为缓解该问题,本文设计了一种可替换内部语言模型(RILM)方法,使得在遇到域偏移时,可在解码阶段将 E2E ASR 模型的内部语言模型(LM)直接替换为目标域 LM。此外,本文提出一种残差 softmax(R-softmax),专为基于 CTC 的 E2E ASR 模型设计,以在推理时无需重新训练即可适应目标域。对于在 LibriSpeech 语料库上训练的 E2E ASR 模型,实验表明,所提方法在 Switchboard 数据上绝对词错率(WER)降低 2.6%,在 AESRC2020 语料上降低 1.0%,同时保持了域内 ASR 结果。
引用
@article{arxiv.2302.08579,
title = {Adaptable End-to-End ASR Models using Replaceable Internal LMs and Residual Softmax},
author = {Keqi Deng and Philip C. Woodland},
journal= {arXiv preprint arXiv:2302.08579},
year = {2023}
}
备注
Accepted by ICASSP2023