多阶段大语言模型管道在相关性评估方面超越GPT-4o
信息检索
2025-01-27 v1
摘要
搜索系统的效果通过表示特定查询和用户有用性的相关性标签进行评估。虽然从真实用户获取这些相关性标签是理想做法,但这种数据收集的规模化具有挑战性。因此,采用第三方标注员,但他们不一致的准确性需要昂贵的审计、培训和监控。我们提出了基于大语言模型的模块化分类管道,将相关性评估任务划分为多个阶段,每个阶段都使用不同的提示和不同规模和能力的模型。应用于TREC 深度学习(TREC-DL)测试集合后,我们的方法相对于OpenAI的GPT-4o mini实现了18.4%的Krippendorff's 准确率提升,同时保持约0.2美元每百万输入token的成本,为相关性评估提供了更高效且更可扩展的解决方案。该方法超过了GPT-4o基线性能(5美元)。在管道方法下,即使是GPT-4o旗舰模型的准确率(以计)也可提高9.7%。
引用
@article{arxiv.2501.14296,
title = {Multi-stage Large Language Model Pipelines Can Outperform GPT-4o in Relevance Assessment},
author = {Julian A. Schnabel and Johanne R. Trippas and Falk Scholer and Danula Hettiachchi},
journal= {arXiv preprint arXiv:2501.14296},
year = {2025}
}
备注
WebConf'25, WWW'25