充分利用数据:面向自动语音识别与翻译的最小代价数据增强
计算与语言
2023-06-12 v2 声音
音频与语音处理
摘要
数据增强是一种基于现有数据生成新训练数据的技术。我们评估了将原始数据样本进行拼接以构建新训练实例的简单且经济高效的方法。使用此类增强数据进行持续训练,能够改进仅在原始数据上优化的现成 Transformer 和 Conformer 模型。我们在 LibriSpeech-960h 测试集上展示了显著的改进(test-clean 和 test-other 上的词错误率 (WER) 分别为 2.83 和 6.87),这些改进延续到了与浅层融合相结合的模型中(WER 分别为 2.55 和 6.27)。我们的持续训练方法还在 CoVoST-2 的 ASR 部分上,针对四种非英语语言带来了高达 0.9 WER 的提升,并且我们观察到这些增益高度依赖于原始训练数据的大小。我们比较了不同的拼接策略,发现我们的方法无需说话人信息即可实现改进。最后,我们在两个数据集上证明,我们的方法同样适用于语音翻译任务。
引用
@article{arxiv.2210.15398,
title = {Make More of Your Data: Minimal Effort Data Augmentation for Automatic Speech Recognition and Translation},
author = {Tsz Kin Lam and Shigehiko Schamoni and Stefan Riezler},
journal= {arXiv preprint arXiv:2210.15398},
year = {2023}
}
备注
Accepted at ICASSP 2023