中文

Rezwan:利用大语言模型进行综合古哈迪德文本处理:120万语料开发

计算与语言 2025-10-07 v1 人工智能

摘要

本文介绍了 Rezwan 的开发,该资源包含超过 120 万条古哈迪德叙述文本,经自动化管道从数字存储库(如 Maktabat Ahl al-Bayt)中提取并结构化。管道运用大语言模型 (LLM) 进行分段、链-文本分离、验证和多层丰富化。每条叙述均增强了包括十二种语言的机器翻译、智能语音标记、抽象摘要、主题标签以及跨文本语义分析。该多步骤过程将原始文本转化为为数字人文和伊斯兰学研究提供的丰富标注基础设施。对 1213 条随机抽取的叙述进行严格评估,由 6 位领域专家评估。结果显示,在链-文本分离(9.33/10)和摘要(9.33/10)等结构化任务中,接近人类水平;同时也凸显了在语音标记和语义相似性检测方面的持续挑战。与手动精选的 Noor 语料库进行比较分析显示,Najm 在规模和质量方面均优于后者,总体平均得分分别为 8.46/10 和 3.66/10。此外,成本分析确认了 AI 方法的经济可行性:耗时超过 229,000 小时的专家工作在数月内完成,且成本仅为极少数。该工作引入了一种新的宗教文本处理范式,表明人工智能如何增强人类专长,使大规模、多语言、语义丰富的伊斯兰遗产访问成为可能。

关键词

引用

@article{arxiv.2510.03781,
  title  = {Rezwan: Leveraging Large Language Models for Comprehensive Hadith Text Processing: A 1.2M Corpus Development},
  author = {Majid Asgari-Bidhendi and Muhammad Amin Ghaseminia and Alireza Shahbazi and Sayyed Ali Hossayni and Najmeh Torabian and Behrouz Minaei-Bidgoli},
  journal= {arXiv preprint arXiv:2510.03781},
  year   = {2025}
}

备注

9 pages, 3 figures