基于残差能量模型的端到端语音识别
音频与语音处理
2021-06-24 v2 计算与语言
机器学习
声音
摘要
具有自回归解码器的端到端模型在自动语音识别 (ASR) 中展现出令人印象深刻的成果。这些模型将序列级概率公式化为给定各自历史的所有单个词符条件概率的乘积。然而,由于暴露偏差等因素,局部归一化模型的性能可能并非最优。因此,模型分布不同于底层数据分布。本文提出残差能量模型 (R-EBM) 以补充自回归 ASR 模型,缩小两个分布之间的差距。同时,R-EBM 也可视为语句级置信度估计器,这可能有益于许多下游任务。在 100 小时 LibriSpeech 数据集上的实验表明,R-EBM 在 test-clean/test-other 集上可将词错误率 (WER) 降低 8.2%/6.7%,同时将置信度分数精确率-召回率曲线下面积提升 12.6%/28.4%。此外,在使用自监督学习 (wav2vec 2.0) 的最优模型上,R-EBM 仍显著改善 WER 与置信度估计性能。
引用
@article{arxiv.2103.14152,
title = {Residual Energy-Based Models for End-to-End Speech Recognition},
author = {Qiujia Li and Yu Zhang and Bo Li and Liangliang Cao and Philip C. Woodland},
journal= {arXiv preprint arXiv:2103.14152},
year = {2021}
}
备注
To appear in Proc. Interspeech 2021