中文

DaReCzech 上文本检索模型的比较研究

信息检索 2024-12-24 v2 人工智能

摘要

本文对 7 个现成的文档检索模型:Splade、Plaid、Plaid-X、SimCSE、Contriever、OpenAI ADA 和 Gemma2 进行了全面评估,以确定它们在捷克语检索数据集 DaReCzech 上的性能。我们实验的首要目标是评估现代检索方法在捷克语中的质量。我们的分析包括检索质量、速度和内存占用。其次,我们分析了是直接在捷克语文本上使用模型更好,还是将机器翻译为英语后进行英语检索更好。我们的实验确定了捷克语信息检索的最有效选项。结果显示,各模型之间存在显著的性能差异,其中 Gemma2 取得了最高的精确率和召回率,而 Contriever 表现较差。最后,SPLADE 和 PLAID 模型在效率和性能之间取得了平衡。

关键词

引用

@article{arxiv.2411.12921,
  title  = {A Comparative Study of Text Retrieval Models on DaReCzech},
  author = {Jakub Stetina and Martin Fajcik and Michal Stefanik and Michal Hradis},
  journal= {arXiv preprint arXiv:2411.12921},
  year   = {2024}
}