中文

面向自监督巴贝格方言语音识别的统一去噪与适应框架

声音 2025-09-03 v1 音频与语音处理

摘要

巴贝格语(Bengali)的语音识别(ASR)仍是一项重大挑战,严重阻碍了其全球27000万说话者的技术可达性。这一挑战由两个持续且交织的因素造成:语言的广泛方言多样性以及现实环境中背景噪声的普遍存在。虽然领先的自监督学习(SSL)模型已为低资源语言推进了ASR,但往往缺乏针对预训练期间环境噪声的显式机制,或缺乏针对巴贝格语不同方言中复杂语音与词汇变体的专业化适应策略。本文提出一种新颖的统一框架,以同时解决这两个挑战。我们的方法基于WavLM模型,该模型在带有掩码语音去噪目标的预训练下,天然具备对声学扰动的鲁棒性。我们提出了一种专业化的多阶段微调策略,首先将模型适应一般领域标准巴贝格语以建立坚实的语言基础,随后通过针对性数据增强将其专门化于面向噪声鲁棒方言识别的场景。该框架在包含多个巴贝格语方言的综合基准测试上进行了严格评估,测试覆盖从干净音频到低信噪比(SNR)水平的广泛模拟噪声条件。实验结果表明,所提框架显著优于强有力的基线,包括标准微调的wav2vec 2.0以及大规模多语言Whisper模型。这一工作为该任务树立了新SOTA,并为全球其他低资源、高变体语言开发实用ASR系统提供了可扩展且有效的蓝图。

关键词

引用

@article{arxiv.2509.00988,
  title  = {A Unified Denoising and Adaptation Framework for Self-Supervised Bengali Dialectal ASR},
  author = {Swadhin Biswas and Imran and Tuhin Sheikh},
  journal= {arXiv preprint arXiv:2509.00988},
  year   = {2025}
}