基于深度学习的基本古兰经诵读规则误读检测
声音
2023-05-12 v1 人工智能
计算与语言
机器学习
音频与语音处理
摘要
在伊斯兰教中,读者必须应用一组称为 Tajweed 规则的发音规则,以天使 Jibrael 教导先知 Muhammad 的同一方式诵读古兰经。学习正确应用这些规则的传统过程需要一位必须持有执照且经验丰富的人来检测误读。由于全球穆斯林数量不断增加,如今 Tajweed 教师的数量不足以满足每位穆斯林的日常诵读练习。因此,已有大量工作致力于自动 Tajweed 规则误读检测,以帮助读者比传统学习方式更轻松、更快速地正确诵读古兰经。以往所有工作存在三个共性问题。首先,大多数仅关注机器学习算法。其次,它们使用无基准可比的私有数据集。第三,尽管语音信号是时间序列,它们未最优地考虑输入数据的序列性。为克服这些问题,我们提出了一种由梅尔频率倒谱系数(MFCC)特征与利用时间序列的长短期记忆(LSTM)神经网络组成的方案,以检测 Tajweed 规则中的误读。此外,我们的实验在一个公共数据集 QDAT 上进行,该数据集包含超过 1500 条三种 Tajweed 规则(Separate stretching、Tight Noon 与 Hide)正确与错误诵读的语音。据我们所知,QDAT 数据集尚未被任何研究论文使用。我们将所提 LSTM 模型与 SoTA 中使用的传统机器学习算法进行比较。带时间序列的 LSTM 模型明显优于传统机器学习。LSTM 在 QDAT 数据集上对三条规则(Separate stretching、Tight Noon 与 Hide)的准确率分别为 96%、95% 与 96%。
引用
@article{arxiv.2305.06429,
title = {Mispronunciation Detection of Basic Quranic Recitation Rules using Deep Learning},
author = {Ahmad Al Harere and Khloud Al Jallad},
journal= {arXiv preprint arXiv:2305.06429},
year = {2023}
}