中文

基于编辑距离的强化学习用于 RNNT 解码

声音 2023-07-17 v2 计算与语言 音频与语音处理

摘要

RNN-T 目前被视为 ASR 的行业标准,因其在各类基准测试中出色的 WERs 以及支持无缝流式与长格式转录的能力。然而其最大缺陷在于训练与推理目标间的显著偏差。训练期间,RNN-T 通过教师强制最大化所有对齐概率,而推理期间使用束搜索,未必能找到最大概率对齐。此外,RNN-T 在教师强制训练中无法经历错误,使其在推理发生错误时问题更甚。为解决该问题,本文提出一种最小化训练与推理时刻间差距的强化学习(Reinforcement Learning)方法。我们基于编辑距离的 RL(EDRL)方法依据编辑距离计算奖励,并在每个动作层级训练网络。所提方法在 LibriSpeech 上为 600M Conformer RNN-T 模型取得了 SoTA WERs。

关键词

引用

@article{arxiv.2306.01789,
  title  = {Edit Distance based RL for RNNT decoding},
  author = {Dongseong Hwang and Changwan Ryu and Khe Chai Sim},
  journal= {arXiv preprint arXiv:2306.01789},
  year   = {2023}
}

备注

5 pages, 2 figures