中文

InPars-Light:高效排序器的低成本无监督训练

信息检索 2024-02-22 v2 人工智能 计算与语言

摘要

我们对 InPars(一种用于神经排序器无监督训练的方法,Bonifacio 等人,2022)进行了可复现性研究。作为副产品,我们开发了 InPars-light,它是 InPars 的一个简单而有效的改进。与 InPars 不同,InPars-light 使用小 7 倍至 100 倍的排序模型,且仅使用免费可用的语言模型 BLOOM,我们发现其产生的排序器比专有的 GPT-3 模型更准确。在原始 InPars 研究使用的全部五个英文检索集合上,我们仅使用 3000 万参数的六层 MiniLM-30M 排序器和单个三样本提示(three-shot prompt),就在 nDCG 和 MRR 上相对于 BM25 取得了显著(7%–30%)且统计意义上可靠的改进。相比之下,在 InPars 研究中,只有大 100 倍的 monoT5-3B 模型一致地优于 BM25,而其较小的 monoT5-220M 模型(仍比我们的 MiniLM 排序器大 7 倍)仅在 MS MARCO 和 TREC DL 2020 上优于 BM25。在相同的三样本提示场景下,我们 4.35 亿参数的 DeBERTA v3 排序器与大 7 倍的 monoT5-3B 表现相当(相对于 BM25 的平均增益为 1.3 对 1.32):事实上,在五个数据集中的三个上,DeBERTA 略优于 monoT5-3B。最后,这些良好结果仅通过对 100 篇候选文档重排序取得,而 Bonifacio 等人(2022)使用了 1000 篇。我们认为 InPars-light 是首个真正具有成本效益的、基于提示的无监督方案,用于训练并部署优于 BM25 的神经排序模型。我们的代码和数据公开可用:https://github.com/searchivarius/inpars_light/

关键词

引用

@article{arxiv.2301.02998,
  title  = {InPars-Light: Cost-Effective Unsupervised Training of Efficient Rankers},
  author = {Leonid Boytsov and Preksha Patel and Vivek Sourabh and Riddhi Nisar and Sayani Kundu and Ramya Ramanathan and Eric Nyberg},
  journal= {arXiv preprint arXiv:2301.02998},
  year   = {2024}
}