Munsit 在 NADI 2025 共享任务 2:通过弱监督预训练与持续监督微调突破多方言阿拉伯语自动语音识别的边界
计算与语言
2025-08-13 v1 人工智能
摘要
自动语音识别(ASR)在实现自然的人机交互中扮演着至关重要的角色,应用范围涵盖虚拟助手、工业自动化、客户支持和实时转录。然而,由于标注数据有限以及多种方言带来的语言复杂性,为像阿拉伯语这样的低资源语言开发准确的ASR系统仍然是一个重大挑战。在这项工作中,我们提出了一种可扩展的训练流程,该流程结合了弱监督学习与监督微调,以开发一个鲁棒的阿拉伯语ASR模型。在第一阶段,我们在15,000小时的弱标注语音上预训练模型,这些语音覆盖了现代标准阿拉伯语(MSA)和各种方言阿拉伯语(DA)变体。在后续阶段,我们使用经过滤的弱标注数据与少量高质量标注数据集的混合进行持续监督微调。我们的方法取得了最先进的结果,在多方言阿拉伯语ASR挑战赛中排名第一。这些发现突显了弱监督与微调相结合在克服数据稀缺和为低资源、方言丰富的语言提供高质量ASR方面的有效性。
引用
@article{arxiv.2508.08912,
title = {Munsit at NADI 2025 Shared Task 2: Pushing the Boundaries of Multidialectal Arabic ASR with Weakly Supervised Pretraining and Continual Supervised Fine-tuning},
author = {Mahmoud Salhab and Shameed Sait and Mohammad Abusheikh and Hasan Abusheikh},
journal= {arXiv preprint arXiv:2508.08912},
year = {2025}
}