ChatGPT 擅长搜索吗?探究大语言模型作为重排序代理
计算与语言
2024-12-31 v3 信息检索
摘要
大语言模型(LLMs)已在包括搜索引擎在内的各类语言相关任务中展现出显著的零样本泛化能力。然而,现有工作利用 LLMs 的生成能力进行信息检索(IR),而非直接段落排序。LLMs 的预训练目标与排序目标之间的差异带来了另一挑战。本文中,我们首先研究生成式 LLMs(如 ChatGPT 与 GPT-4)在 IR 中的相关性排序。令人惊讶的是,实验表明,经恰当指令引导的 LLMs 能在流行 IR 基准上取得与最先进监督方法相当甚至更优的结果。此外,为应对 LLMs 数据污染的担忧,我们收集了一个名为 NovelEval 的新测试集,基于最新知识并旨在验证模型对未知知识的排序能力。最后,为提升实际应用的效率,我们深入探究了利用排列蒸馏方案将 ChatGPT 的排序能力蒸馏至小型专用模型的潜力。评估结果表明,一个蒸馏得到的 440M 模型在 BEIR 基准上优于 3B 监督模型。复现结果的代码见 www.github.com/sunnweiwei/RankGPT。
引用
@article{arxiv.2304.09542,
title = {Is ChatGPT Good at Search? Investigating Large Language Models as Re-Ranking Agents},
author = {Weiwei Sun and Lingyong Yan and Xinyu Ma and Shuaiqiang Wang and Pengjie Ren and Zhumin Chen and Dawei Yin and Zhaochun Ren},
journal= {arXiv preprint arXiv:2304.09542},
year = {2024}
}
备注
EMNLP 2023