基于端到端深度学习的古兰经诵念识别
音频与语音处理
2023-05-15 v1 人工智能
计算与语言
机器学习
声音
摘要
《古兰经》是伊斯兰教的神圣经典,其诵念是宗教的重要方面。由于古兰经诵念具有正常言语中不适用的独特规则,自动识别其诵念是一项具有挑战性的任务。该领域已有大量研究,但以往工作或将诵念错误检测作为分类任务,或使用了传统的自动语音识别(ASR)。本文提出了一种新颖的端到端深度学习模型用于识别《古兰经》诵念。所提模型为CNN-双向GRU编码器,使用CTC作为目标函数,以及基于字符的束搜索解码器。此外,以往工作均基于包含短节和少数章节的小型私有数据集,由于使用私有数据集,未进行比较。为克服该问题,我们使用了近期发布的公共数据集Ar-DAD,其包含约37个章节,由30位诵读者以不同诵念速度和不同发音规则类型诵读。所提模型性能使用语音识别中最常见的评估指标词错误率(WER)和字符错误率(CER)进行评估,结果分别为8.34% WER和2.42% CER。希望本研究能作为在该公共新数据集(Ar-DAD)上与未来研究进行比较的基线。
引用
@article{arxiv.2305.07034,
title = {Quran Recitation Recognition using End-to-End Deep Learning},
author = {Ahmad Al Harere and Khloud Al Jallad},
journal= {arXiv preprint arXiv:2305.07034},
year = {2023}
}