中文

Mubeen AI:面向文化遗产保护与用户意图理解的专用阿拉伯语语言模型

计算与语言 2025-10-28 v1

摘要

Mubeen是由MASARAT SA开发的专用阿拉伯语语言模型,针对阿拉伯语言学、伊斯兰学及文化遗产进行深度优化。该模型基于大量真实阿拉伯语资料训练,包括通过专用阿拉伯语OCR引擎数字化的历史手稿、语言学、宗教法、古典传说及《古琴经》注释学术著作,以及数千篇学术论文和同行评审研究论文。经过深入的语言工程框架训练,Mubeen不仅掌握阿拉伯语的含义,更精通其修辞,能够准确理解古典文本、现代书写及地区方言,尤其注重理解用户意图并提供准确、情境相关的响应。与其他依赖翻译英文数据的阿拉伯语模型不同,Mubeen采用原生阿拉伯语资料,确保文化真实性与准确性。其核心创新是“Practical Closure Architecture”(实用闭合架构),旨在解决“实用性差距危机”,即即使答案事实正确,也可能未能满足用户核心需求,导致反复提问的挫败循环。通过优先清晰和果断指导,Mubeen从信息仓库转变为决策指南,契合沙特2030愿景。该模型融合深厚的文化遗产专业知识与多学科专家模块,实现了文化保护与通用知识领域的稳健性能能。

关键词

引用

@article{arxiv.2510.23271,
  title  = {Mubeen AI: A Specialized Arabic Language Model for Heritage Preservation and User Intent Understanding},
  author = {Mohammed Aljafari and Ismail Alturki and Ahmed Mori and Yehya Kadumi},
  journal= {arXiv preprint arXiv:2510.23271},
  year   = {2025}
}

备注

21 pages, 2 figures, 3 tables. Includes appendices on ethical guidelines and training framework. Submitted September 04, 2025