用于自动语音识别时间高效训练的带预训练的深度强化学习
音频与语音处理
2020-05-25 v1 声音
摘要
深度强化学习(deep RL)是深度学习与强化学习原理的结合,旨在创建能通过与环境交互来学习的高效方法。这已在许多复杂任务中取得突破,例如玩“围棋”游戏,这些任务以前难以解决。然而,深度强化学习需要大量的训练时间,使其难以用于各种现实应用,如人机交互(HCI)。在本文中,我们研究了深度强化学习中的预训练,以减少训练时间并提高语音识别这一流行的 HCI 应用的性能。为评估训练中的性能提升,我们使用了公开的“语音命令”数据集,该数据集包含 2,618 位说话者说出的 30 个命令关键词的语音。结果表明,与非预训练的强化学习相比,带预训练的深度强化学习收敛速度更快,同时实现了更高的语音识别准确率。
引用
@article{arxiv.2005.11172,
title = {Deep Reinforcement Learning with Pre-training for Time-efficient Training of Automatic Speech Recognition},
author = {Thejan Rajapakshe and Siddique Latif and Rajib Rana and Sara Khalifa and Björn W. Schuller},
journal= {arXiv preprint arXiv:2005.11172},
year = {2020}
}
备注
arXiv admin note: substantial text overlap with arXiv:1910.11256