中文

使用微调小型大语言模型构建增强相关性数据集

信息检索 2025-04-15 v1 计算与语言

摘要

构建高质量数据集和对查询-文档相关性进行标注是essential且资源密集型的任务,需要详细的指南和来自人类标注员的大量努力。本文探讨了使用小型微调大语言模型(LLMs)来自动进行相关性评估的方法,重点是通过增强训练数据集来提高排序模型的性能。我们微调小型LLMs以提高相关性评估,从而提高用于下游排序模型训练的数据集创建质量。我们的实验表明,这些微调后的小型LLMs不仅在我们的数据集上超过某些封闭源模型,还在排序模型性能上带来显著的改进。这些结果凸显了利用小型LLMs实现高效和可扩展数据增强的潜力,为搜索引擎优化提供了实用解决方案。

关键词

引用

@article{arxiv.2504.09816,
  title  = {Augmented Relevance Datasets with Fine-Tuned Small LLMs},
  author = {Quentin Fitte-Rey and Matyas Amrouche and Romain Deveaud},
  journal= {arXiv preprint arXiv:2504.09816},
  year   = {2025}
}

备注

10 pages, 3 figures, and 6 tables. Accepted and presented to LLM4EVAL at WSDM '25