基于强化学习的序列到序列 ASR 优化
计算与语言
2018-03-01 v2 机器学习
声音
音频与语音处理
摘要
尽管序列到序列方法在自动语音识别(ASR)系统中取得成功,模型仍受若干问题的困扰,主要源于训练与推理条件的不匹配。在序列到序列架构中,模型被训练为给定语音信号输入与前一时步真实字符历史,预测当前时步的字符。然而,模型在推理时逼近真实世界语音的程度仍不清楚。因此,基于先前预测从头生成整体转录文本是复杂的,且错误会随时间传播。此外,模型被优化以最大化训练数据的似然,而非实际量化识别质量的错误率评价指标。本文提出一种采用强化学习(RL)思想训练序列到序列 ASR 模型的替代策略。与最大似然估计的标准训练方案不同,我们提出的方法利用策略梯度算法。我们可以(1)在训练过程中基于模型预测对整体转录文本采样,以及(2)直接以负 Levenshtein 距离作为奖励优化模型。实验结果表明,相较于仅以最大似然估计训练的模型,我们显著提升了性能。
引用
@article{arxiv.1710.10774,
title = {Sequence-to-Sequence ASR Optimization via Reinforcement Learning},
author = {Andros Tjandra and Sakriani Sakti and Satoshi Nakamura},
journal= {arXiv preprint arXiv:1710.10774},
year = {2018}
}
备注
Accepted at ICASSP 2018