TWOLAR:基于两阶段 LLM 蒸馏的 passage reranking 方法
信息检索
2024-03-27 v1
摘要
本文提出 TWOLAR:一个基于 Large Language Model (LLM) 蒸馏的两阶段 passage reranking 流程。TWOLAR 引入了新的评分策略和一个蒸馏过程,包含创建新型且多样化训练数据集的过程。该数据集包含 20K 个查询,每个查询与通过四种不同检索方法检索到的文档集合关联,然后利用 LLM 的零样本 reranking 能力进行排序。我们的消融研究表明,我们引入的每个新组件的贡献。我们的实验结果显示,TWOLAR 在 TREC-DL 测试集和零样本评估基准 BEIR 上显著提升了底层模型的文档 reranking 能力,甚至在某些情况下超过参数数量高出三个数量级的 state-of-the-art 模型。为促进未来工作,我们发布了数据集、微调模型和代码。
引用
@article{arxiv.2403.17759,
title = {TWOLAR: a TWO-step LLM-Augmented distillation method for passage Reranking},
author = {Davide Baldelli and Junfeng Jiang and Akiko Aizawa and Paolo Torroni},
journal= {arXiv preprint arXiv:2403.17759},
year = {2024}
}