基于音素的神经转导器的无格序列判别训练
音频与语音处理
2023-05-26 v3 人工智能
计算与语言
机器学习
声音
摘要
近年来,RNN-Transducers 在各种自动语音识别任务上取得了显著成果。然而,在混合模型中表现优异的无格序列判别训练方法,在 RNN-Transducers 中很少被研究。在本工作中,我们提出了三种无格训练目标,即无格最大互信息、无格段级最小贝叶斯风险和无格最小贝叶斯风险,它们用于具有有限上下文依赖的基于音素的神经转导器的最终后验输出。与使用 N-best 列表的准则相比,无格方法消除了训练期间用于生成假设的解码步骤,从而实现了更高效的训练。实验结果表明,与序列级交叉熵训练模型相比,无格方法在词错误率上获得了高达 6.5% 的相对提升。与基于 N-best 列表的最小贝叶斯风险目标相比,无格方法在性能仅有微小退化的情况下获得了 40% 至 70% 的相对训练时间加速。
引用
@article{arxiv.2212.04325,
title = {Lattice-Free Sequence Discriminative Training for Phoneme-Based Neural Transducers},
author = {Zijian Yang and Wei Zhou and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:2212.04325},
year = {2023}
}
备注
accepted at ICASSP 2023