中文

Quran-MD:一个细粒度的多语言多模态《古兰经》数据集

计算机视觉与模式识别 2026-01-27 v1

摘要

我们提出了 Quran MD,一个全面的多模态《古兰经》数据集,它在经文和单词级别整合了文本、语言学和音频维度。对于每一节经文,该数据集提供了其原始阿拉伯语文本、英文翻译和音标转写。为了捕捉《古兰经》诵读的丰富口述传统,我们收录了 32 位不同诵经者的经文级音频,反映了多样的诵读风格和方言细微差别。在单词级别,每个词元都配有相应的阿拉伯语脚本、英文翻译、转写和对齐的音频记录,从而允许对发音、语音学和语义上下文进行细粒度分析。该数据集支持多种应用,包括自然语言处理、语音识别、文本到语音合成、语言学分析以及数字伊斯兰研究。该数据集跨越多位诵经者连接了文本和音频模态,为推进《古兰经》诵读和研究的计算方法提供了独特资源。除了支持诸如 ASR、tajweed 检测和《古兰经》TTS 等任务外,它还为多模态嵌入、语义检索、风格迁移和个性化辅导系统奠定了基础,这些系统能够支持研究和社区应用。该数据集可在 https://huggingface.co/datasets/Buraaq/quran-audio-text-dataset 获取。

关键词

引用

@article{arxiv.2601.17880,
  title  = {Quran-MD: A Fine-Grained Multilingual Multimodal Dataset of the Quran},
  author = {Muhammad Umar Salman and Mohammad Areeb Qazi and Mohammed Talha Alam},
  journal= {arXiv preprint arXiv:2601.17880},
  year   = {2026}
}

备注

6 pages, 2 tables and 2 figures