伊斯兰文本多语言信息检索的高效通用模型:真实场景下的开发与部署
信息检索
2025-10-15 v2 人工智能
计算与语言
摘要
尽管多语言信息检索 (MLIR) 近期取得了显著进展,但研究与实际部署之间仍存在显著差距。许多研究在孤立环境中评估 MLIR 性能,限制了其在真实场景中的适用性。在本工作中,我们利用古兰经多语言语料库的独特特征,研究开发针对伊斯兰领域的临时信息检索系统的最优策略,该系统旨在满足用户多语言的信息需求。我们准备了十一个检索模型,采用四种训练方法:单语、跨语言、翻译-训练全部,以及一种结合跨语言和单语技术的新型混合方法。在域内数据集上的评估表明,混合方法在多样化的检索场景中取得了有前景的结果。此外,我们提供了详细分析,探讨不同训练配置如何影响嵌入空间及其对多语言检索有效性的影响。最后,我们讨论了部署考虑因素,强调部署单一通用、轻量级模型用于真实 MLIR 应用的成本效率。
引用
@article{arxiv.2509.15380,
title = {Efficient and Versatile Model for Multilingual Information Retrieval of Islamic Text: Development and Deployment in Real-World Scenarios},
author = {Vera Pavlova and Mohammed Makhlouf},
journal= {arXiv preprint arXiv:2509.15380},
year = {2025}
}