中文

推进波斯语的检索增强生成:语言模型开发、综合基准与优化最佳实践

计算与语言 2025-01-10 v1

摘要

本文研究了在低资源语言下构建检索增强生成(RAG)系统的具体障碍,重点关注波斯语复杂的形态学和灵活的句法。本研究旨在通过引入波斯语专用模型,即 MatinaRoberta(掩码语言模型)和 MatinaSRoberta(微调的 Sentence-BERT),以及一个综合的基准测试框架,来提高检索和生成的准确性。这些模型在包含 731.1 亿波斯语词元的多样化语料库上训练后,使用了三个数据集——通用知识(PQuad)、科学专业文本和组织报告——进行评估。该方法论包括广泛的预训练、使用定制损失函数进行微调,以及使用传统指标和检索增强生成评估框架进行系统评估。结果表明,MatinaSRoberta 优于先前的嵌入模型,在各个数据集上实现了卓越的上下文相关性和检索准确性。为了增强 RAG 设置,本文探索了温度调整、块大小修改和文档摘要索引。Llama-3.1 (70B) 等较大模型始终表现出最高的生成准确性,而较小模型在特定领域和正式语境中面临挑战。研究结果强调了通过定制嵌入和检索-生成设置开发波斯语 RAG 系统的潜力,并突显了低资源语言中 NLP 应用(如搜索引擎和法律文档分析)的改进。

关键词

引用

@article{arxiv.2501.04858,
  title  = {Advancing Retrieval-Augmented Generation for Persian: Development of Language Models, Comprehensive Benchmarks, and Best Practices for Optimization},
  author = {Sara Bourbour Hosseinbeigi and Sina Asghari and Mohammad Ali Seif Kashani and Mohammad Hossein Shalchian and Mohammad Amin Abbasi},
  journal= {arXiv preprint arXiv:2501.04858},
  year   = {2025}
}