SAGE:用于增强阿拉伯-英语双语语种低资源语种语音识别的拼接音频生成数据
计算与语言
2025-06-30 v1 声音
音频与语音处理
摘要
本文探讨了各种语音自监督学习模型在Dialectal Arabic (DA) 和阿拉伯-英语双语语种语音上的表现。为解决数据稀缺问题,引入修改版音频拼接方法以生成人工CS语音数据。对已微调的SSL模型进行微调,使用所提出的拼接音频生成(SAGE)数据可在阿拉伯和英语CS基准测试上实现Word Error Rate (WER)提升7.8%。此外,提出一种受经验回放(ER)启发的方法,以增强DA和CS语音的泛化性,同时缓解灾难性遗忘。集成基于out-of-domain 3-gram语言模型可将整体平均WER从31.7%降至26.6%。少量微调双语语种基准进一步提升WER 4.9%。达到31.1%的阿拉伯-英语CS基准WER,超越USM和Whisper-large-v2(规模均超过十倍)以绝对幅度提升5.5%和8.4%。
引用
@article{arxiv.2506.22143,
title = {SAGE: Spliced-Audio Generated Data for Enhancing Foundational Models in Low-Resource Arabic-English Code-Switched Speech Recognition},
author = {Muhammad Umar Farooq and Oscar Saz},
journal= {arXiv preprint arXiv:2506.22143},
year = {2025}
}
备注
Accepted for IEEE MLSP 2025