ROAR:强化原始与增强数据比率动态的Wav2Vec2.0基于ASR
音频与语音处理
2024-06-17 v1
摘要
虽然自动语音识别(ASR)从数据增强中获益良多,但增强配方本身倾向于采用启发式方法。在本文中,我们针对ASR训练中平衡原始与增强数据比率的启发式方法,引入基于强化学习(RL)的动态调整原始-增强数据比率(OAR)。不同于常规数据增强中的固定OAR方法,我们的方法采用深度Q网络(DQN)作为RL机制,以在Wav2Vec2.0基于ASR训练期间学习OAR的最优动态。在使用LibriSpeech数据集进行实验时,分别使用10Min、1H、10H和100H四种训练数据量来评估该方法在不同数据条件下的有效性。我们的方法在LibriSpeech标准测试集上,平均比开源Wav2Vec2.0 base模型提高4.96%。
引用
@article{arxiv.2406.09999,
title = {ROAR: Reinforcing Original to Augmented Data Ratio Dynamics for Wav2Vec2.0 Based ASR},
author = {Vishwanath Pratap Singh and Federico Malato and Ville Hautamaki and Md. Sahidullah and Tomi Kinnunen},
journal= {arXiv preprint arXiv:2406.09999},
year = {2024}
}
备注
Accepted: Interspeech 2024