双语伊斯兰 LLM 用于神经 Passage 检索的多阶段训练
密码学与安全
2025-01-20 v1
摘要
本研究考察了自然语言处理 (NLP) 技术在伊斯兰领域的应用,聚焦于开发伊斯兰神经检索模型。通过利用强大的 XLM-R 模型,研究采用语言缩减技术创建轻量级双语大型语言模型 (LLM)。我们的方法针对伊斯兰领域的独特挑战进行领域适应,该领域仅在阿拉伯语中存在大量领域内语料,而在其他语言(包括英语)中则有限。该工作采用检索模型的多阶段训练方法,融合大型检索数据集(如 MS MARCO),以及较小的领域内数据集以提高检索性能。此外,我们通过数据增强技术并借助可靠的伊斯兰来源,策划了英文领域检索数据集。该方法增强了领域特定检索数据集,进一步提升了性能。研究结果表明,结合领域适应和双语伊斯兰神经检索模型的多阶段训练方法,可使其在下游检索任务中超越单语模型。
引用
@article{arxiv.2501.10174,
title = {Michscan: Black-Box Neural Network Integrity Checking at Runtime Through Power Analysis},
author = {Robi Paul and Michael Zuzak},
journal= {arXiv preprint arXiv:2501.10174},
year = {2025}
}
备注
11 pages, 7 figures. To appear in IEEE International Symposium on Hardware Oriented Security and Trust (HOST) 2025. This material is based upon work supported by the National Science Foundation under Grant No. 2245573