基于深度学习的圣诗学说者发音错误检测与纠正
音频与语音处理
2025-09-03 v1 人工智能
计算与语言
机器学习
声音
摘要
评估语言发言具有挑战性,为机器学习模型量化发音指标更为困难。然而,对于圣诗,由于穆斯林学者确立的严格朗诵规则(tajweed),这一任务得以简化,从而实现高效评估。尽管存在这一优势,但高质量标注数据的稀缺仍是重大障碍。本文通过引入:(1)一个98%自动化的管道,用于生产高质量的圣诗数据集——包括:收集专家朗诵录音、在停顿点(waqf)进行分段(使用我们微调的wav2vec2-BERT模型)、录音转写、录音通过我们新颖的Tasmeea算法进行验证;(2)850+小时的音频(约30万段标注语料);(3)一种基于ASR的新颖方法用于发音错误检测,利用我们定制的圣诗语音脚本(QPS)对编码tajweed规则(不同于IPA标准的现代标准阿拉伯语);QPS采用两级脚本:(音素级):编码阿拉伯字母及其短/长元音。(Sifa级):编码每个音素的发音特征。我们进一步包括我们新颖的多级CTC模型,实现了测试集上0.16%的平均音素错误率(PER)。我们以开源方式发布所有代码、数据和模型:https://obadx.github.io/prepare-quran-dataset/
引用
@article{arxiv.2509.00094,
title = {Automatic Pronunciation Error Detection and Correction of the Holy Quran's Learners Using Deep Learning},
author = {Abdullah Abdelfattah and Mahmoud I. Khalil and Hazem Abbas},
journal= {arXiv preprint arXiv:2509.00094},
year = {2025}
}