零样 LLM 排序器提示词变体的研究
信息检索
2025-07-28 v4 计算与语言
摘要
我们提供了系统性的理解,揭示特定提示词组件和措辞对基于零样本大语言模型(LLM)排序器效果的影响。近期有多个基于 LLM 的零样本排序方法被提出。从许多方面入手,这些方法在 (1) 实现的排序算法方面存在差异,例如点排序法与列表排序法, (2) 所采用的底层 LLM 方面存在差异,例如 GPT3.5 与 FLAN-T5, (3) 提示词中使用的组件和措辞方面存在差异,例如是否使用角色定义(角色扮演)以及实际使用的词语表达。目前尚不清楚,性能差异是源于底层排序算法,还是源于诸如提示词中更佳选词等瞬时因素的结果。这种混淆风险可能削弱未来研究的进展。通过大规模实验与分析,我们发现排序算法确实对基于 LLM 零样本排序方法之间的差异有所贡献。然而,LLM 底层模型也有所影响——但更重要的是,提示词组件和措辞的选择会影响排序效果。事实上,在我们的实验中,我们发现,这些后者元素有时对排序器的效果影响甚至超过实际的排序算法,并且在考虑提示词变体后,排序方法之间的差异变得更加模糊。
关键词
引用
@article{arxiv.2406.14117,
title = {An Investigation of Prompt Variations for Zero-shot LLM-based Rankers},
author = {Shuoqi Sun and Shengyao Zhuang and Shuai Wang and Guido Zuccon},
journal= {arXiv preprint arXiv:2406.14117},
year = {2025}
}
备注
Accepted for publication at the 47th European Conference on Information Retrieval (ECIR 2025)