基于分段调度的样本自适应数据增强
声音
2024-12-03 v1 音频与语音处理
摘要
数据增强是广泛采用的技术,用于提高自动语音识别 (ASR) 的鲁棒性。采用固定的数据增强策略处理所有训练数据是常见做法。然而,需要注意的是,在单个训练小批量中的不同样本可能存在背景噪声、语速等因素的差异。使用固定的增强策略可能导致模型达到次优状态。除了采用固定增强策略的风险外,模型的能力也可能在不同训练阶段有所不同。为此,本文提出一种称为样本自适应数据增强与分段调度 (PS-SapAug) 的方法。所提出的方法采用两阶段训练方法,在各阶段应用动态数据增强。它采用混合归一化方法根据每个样本的损失计算样本特定的增强参数。此外,增强概率在训练过程中逐渐增加。我们在流行的 ASR 基准数据集上对该方法进行评估,包括 Aishell-1 和 Librispeech-100h。在 Librispeech-100h test-clean 上实现了最高达 8.13% 的词错误率 (WER) 降低,在 test-other 上降低 6.23%,在 AISHELL-1 测试集上降低 5.26%,展示了该方法提升性能并最小化错误的有效性。
引用
@article{arxiv.2412.00415,
title = {Sample adaptive data augmentation with progressive scheduling},
author = {Hongxuan Lu and Biao Li},
journal= {arXiv preprint arXiv:2412.00415},
year = {2024}
}