在固定证据池下诊断 LLM 重排序器行为
机器学习
2026-02-24 v1 计算与语言
信息检索
摘要
标准重排序评估研究重排序器如何排序由上游检索器返回的候选结果。此设置将排序行为与检索质量耦合,因此无法将差异归因于排序策略alone。我们引入一种受控诊断方法,通过使用 Multi-News 聚类作为固定证据池来隔离重排序。我们将每个池限制为恰好八个文档,并将相同输入传递给所有重排序器。在此设置下,BM25 和 MMR 作为词汇匹配和多样性优化的可解释参考点。我们在 345 个聚类中发现,冗余模式因模型而异:一个 LLM 在较大选择预算下隐式多样化,而另一个增加冗余。相比之下,LLMs 在小预算下在词汇覆盖方面表现不佳。结果是,LLM 排序与两个基线之间差异很大,而非始终近似其中一种策略。通过消除检索方差,我们可以直接归因于排序策略。该诊断方法与模型无关,可应用于任何重排序器,包括开源系统和专有 API。
引用
@article{arxiv.2602.18613,
title = {Diagnosing LLM Reranker Behavior Under Fixed Evidence Pools},
author = {Baris Arat and Emre Sefer},
journal= {arXiv preprint arXiv:2602.18613},
year = {2026}
}