噪声下的 ASR:探索巽他语和爪哇语的鲁棒性
计算与语言
2025-10-01 v1
摘要
我们研究了基于 Whisper 的自动语音识别(ASR)模型在两种主要的印度尼西亚区域语言——爪哇语和巽他语上的鲁棒性。尽管近期的研究表明 ASR 在干净条件下表现优异,但其在噪声环境中的有效性仍不明确。为了解决这一问题,我们实验了多种训练策略,包括合成噪声增强和 SpecAugment,并在一系列信噪比下评估了性能。我们的结果表明,噪声感知训练显著提高了鲁棒性,尤其是对于较大的 Whisper 模型。详细的错误分析进一步揭示了特定语言的挑战,为未来的改进指明了方向。
引用
@article{arxiv.2509.25878,
title = {ASR Under Noise: Exploring Robustness for Sundanese and Javanese},
author = {Salsabila Zahirah Pranida and Muhammad Cendekia Airlangga and Rifo Ahmad Genadi and Shady Shehata},
journal= {arXiv preprint arXiv:2509.25878},
year = {2025}
}