基于编辑距离的强化学习用于 RNNT 解码
声音
2023-07-17 v2 计算与语言
音频与语音处理
摘要
RNN-T 目前被视为 ASR 的行业标准,因其在各类基准测试中出色的 WERs 以及支持无缝流式与长格式转录的能力。然而其最大缺陷在于训练与推理目标间的显著偏差。训练期间,RNN-T 通过教师强制最大化所有对齐概率,而推理期间使用束搜索,未必能找到最大概率对齐。此外,RNN-T 在教师强制训练中无法经历错误,使其在推理发生错误时问题更甚。为解决该问题,本文提出一种最小化训练与推理时刻间差距的强化学习(Reinforcement Learning)方法。我们基于编辑距离的 RL(EDRL)方法依据编辑距离计算奖励,并在每个动作层级训练网络。所提方法在 LibriSpeech 上为 600M Conformer RNN-T 模型取得了 SoTA WERs。
引用
@article{arxiv.2306.01789,
title = {Edit Distance based RL for RNNT decoding},
author = {Dongseong Hwang and Changwan Ryu and Khe Chai Sim},
journal= {arXiv preprint arXiv:2306.01789},
year = {2023}
}
备注
5 pages, 2 figures