面向障碍性语音识别的自动数据增强
音频与语音处理
2023-12-15 v1 声音
摘要
由于数据稀缺,障碍性语音的自动识别至今仍是一项极具挑战性的任务。本文提出了一种基于强化学习(RL)的在线数据增强方法,用于在此类数据上训练最先进的 PyChain TDNN 和端到端 Conformer ASR 系统。标准 SpecAugment 方法中依赖于任务和系统的手工时域和频域掩码操作,连同额外引入的这些时频掩码的最小和最大截断值,现在均使用基于 RNN 的策略控制器自动学习,并与 ASR 系统训练紧密集成。在 UASpeech 语料库上的实验表明,所提出的基于 RL 的数据增强方法持续产生优于或可比于使用专家或手工 SpecAugment 策略所获得的性能。我们的 RL 自动增强 PyChain TDNN 系统在包含 16 名构音障碍说话者的 UASpeech 测试集上取得了 28.79% 的总体词错误率(WER)。
关键词
引用
@article{arxiv.2312.08641,
title = {Towards Automatic Data Augmentation for Disordered Speech Recognition},
author = {Zengrui Jin and Xurong Xie and Tianzi Wang and Mengzhe Geng and Jiajun Deng and Guinan Li and Shujie Hu and Xunying Liu},
journal= {arXiv preprint arXiv:2312.08641},
year = {2023}
}
备注
To appear at IEEE ICASSP 2024