低资源语音识别中极其简单的噪声数据增强方法
计算与语言
2026-01-21 v3
摘要
本文介绍三种用于低资源自动语音识别(ASR)的自包含数据增强方法。我们的技术首先生成新的文本——使用基于词汇的替换、随机替换或基于 LLM 的方法——然后应用语音合成(TTS)生成合成音频。我们将这些方法应用于资源极其有限的四种语言(Vatlongos、Nashta、Shinekhen Buryat 和 Kakabe),仅使用原始标注数据进行微调的预训练 Wav2Vec2-XLSR-53 模型可显著提升性能,其中 Nashta 的绝对词错率(WER)降低了 14.3%。这些方法在所有四种低资源语言上均有效,并且也对像英语这样的高资源语言显示出实用性,表明其广泛适用性。
引用
@article{arxiv.2509.15373,
title = {Frustratingly Easy Data Augmentation for Low-Resource ASR},
author = {Katsumi Ibaraki and David Chiang},
journal= {arXiv preprint arXiv:2509.15373},
year = {2026}
}
备注
5 pages, 2 figures, 2 tables