中文

构建面向伊斯兰领域的高效多语言非营利信息检索系统:基于 Rust 的多进程设计

计算与语言 2024-11-12 v1

摘要

大型语言模型(LLM)的广泛应用显著提升了自然语言处理(NLP)中的许多应用,包括信息检索(IR)。然而,缺乏商业驱动力的领域往往滞后于受益于人工智能技术的步伐。其中一个典型领域是宗教与遗产语料库。伊斯兰文学不仅具有重要的文化价值,还被学者和公众广泛利用。如何高效检索这大量文本数据 remains a 挑战,而当前缺乏一个统一的资源,能够利用先进的人工智能工具进行便捷检索。本文聚焦于开发面向伊斯兰领域的多语言非营利信息检索系统。该过程面临诸多挑战,包括在数据在某些语言中有限的情况下准备多语言领域特定语料库、在资源受限的设备上部署模型,以及在有限预算下实现快速检索。通过采用如领域适应的继续预训练和语言压缩以降低模型规模等方法,我们准备了一个轻量级多语言检索模型,相较于在通用领域数据上预训练的大型模型,展示了卓越的性能。此外,评估所提出的架构表明,Rust 语言的特性使得即使在资源受限的环境中也能够实现高效的语义搜索。

关键词

引用

@article{arxiv.2411.06151,
  title  = {Building an Efficient Multilingual Non-Profit IR System for the Islamic Domain Leveraging Multiprocessing Design in Rust},
  author = {Vera Pavlova and Mohammed Makhlouf},
  journal= {arXiv preprint arXiv:2411.06151},
  year   = {2024}
}