中文

关于混合自回归转导器的最小词错率训练

计算与语言 2021-03-29 v3 音频与语音处理

摘要

混合自回归转导器(HAT)是最近提出的一种端到端声学模型,它扩展了标准循环神经网络转导器(RNN-T)以实现外部语言模型(LM)融合。在HAT中,空白概率与标签概率由两个不同的概率分布估计,这为内部LM分数估计提供了更精确的方案,从而在与外部LM结合时表现更好。先前工作主要关注使用负对数似然损失训练HAT模型,而本文研究HAT的最小词错率(MWER)训练——该准则更贴近语音识别的评测指标,并已成功应用于序列到序列(S2S)和RNN-T等其他类型的端到端模型。在约30,000小时训练数据的实验中,我们表明MWER训练可提升HAT模型的准确率,同时增强模型对推理时长度归一化和解码beam等解码超参数的鲁棒性。

关键词

引用

@article{arxiv.2010.12673,
  title  = {On Minimum Word Error Rate Training of the Hybrid Autoregressive Transducer},
  author = {Liang Lu and Zhong Meng and Naoyuki Kanda and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:2010.12673},
  year   = {2021}
}

备注

5 pages, 1 figure. Accepted to ICASSP 2021, but we withdrawn due to a bug in code. We updated the results after the bug fix, and submitted the paper to Interspeech 2021