中文

基于强化学习的序列到序列 ASR 优化

计算与语言 2018-03-01 v2 机器学习 声音 音频与语音处理

摘要

尽管序列到序列方法在自动语音识别(ASR)系统中取得成功,模型仍受若干问题的困扰,主要源于训练与推理条件的不匹配。在序列到序列架构中,模型被训练为给定语音信号输入与前一时步真实字符历史,预测当前时步的字符。然而,模型在推理时逼近真实世界语音的程度仍不清楚。因此,基于先前预测从头生成整体转录文本是复杂的,且错误会随时间传播。此外,模型被优化以最大化训练数据的似然,而非实际量化识别质量的错误率评价指标。本文提出一种采用强化学习(RL)思想训练序列到序列 ASR 模型的替代策略。与最大似然估计的标准训练方案不同,我们提出的方法利用策略梯度算法。我们可以(1)在训练过程中基于模型预测对整体转录文本采样,以及(2)直接以负 Levenshtein 距离作为奖励优化模型。实验结果表明,相较于仅以最大似然估计训练的模型,我们显著提升了性能。

关键词

引用

@article{arxiv.1710.10774,
  title  = {Sequence-to-Sequence ASR Optimization via Reinforcement Learning},
  author = {Andros Tjandra and Sakriani Sakti and Satoshi Nakamura},
  journal= {arXiv preprint arXiv:1710.10774},
  year   = {2018}
}

备注

Accepted at ICASSP 2018