Hakim:波斯文本嵌入模型
计算与语言
2025-10-10 v3 人工智能
机器学习
摘要
文本嵌入的最新进展显著提升了跨多语言的自然语言理解能力,但波斯语在大规模嵌入研究中仍显得被低估。本文提出了哈希姆(Hakim),一种新的波斯文本嵌入模型,在 FaMTEB 基准上实现了 8.5% 的性能提升,超越了所有先前开发的波斯语言模型。为支持监督和无监督训练场景,本文还引入了三个新数据集——Corpesia、Pairsia-sup 和 Pairsia-unsup。此外,哈希姆设计用于聊天机器人和检索增强生成(RAG)系统,尤其针对需要在这些系统中集成消息历史的检索任务。我们还提出了基于 BERT 架构构建的新基线模型。该语言模型在各种波斯语 NLP 任务中始终实现更高的准确率,而基于 RetroMAE 的模型在文本信息检索应用中表现尤为有效。通过这些贡献,哈希姆为推动波斯语言理解的发展奠定了新的基础。
引用
@article{arxiv.2505.08435,
title = {Hakim: Farsi Text Embedding Model},
author = {Mehran Sarmadi and Morteza Alikhani and Erfan Zinvandi and Zahra Pourbahman},
journal= {arXiv preprint arXiv:2505.08435},
year = {2025}
}