中文

LLM-RankFusion:缓解基于LLM的排序中的内在不一致性

信息检索 2024-11-27 v2 人工智能 计算与语言

摘要

通过提示大型语言模型(LLM)对段落进行排序可以在现代信息检索(IR)系统中取得有前景的性能。一种常见的排序列表方法是提示LLM进行成对或集合比较,这通常依赖于排序算法。然而,基于排序的方法需要一致的比较才能正确地对段落进行排序,而我们表明LLM经常违反这一点。我们识别了基于LLM的成对比较中的两种内在不一致性:顺序不一致性(当交换段落顺序时导致冲突结果)和传递不一致性(导致所有偏好对之间出现非传递三元组)。我们对这些不一致性的研究对于理解和改进任何基于相对偏好的排序方案的稳定性具有重要意义。在本文中,我们提出了LLM-RankFusion,一个基于LLM的排序框架,它缓解了这些不一致性并产生了一个稳健的排序列表。LLM-RankFusion使用上下文学习(ICL)来演示顺序无关的比较,并通过校准来估计两个段落之间的潜在偏好概率,从而缓解顺序不一致性。然后,我们通过聚合来自多个排序器的排序结果来解决传递不一致性。在我们的实验中,我们经验性地表明,LLM-RankFusion可以显著减少不一致的比较结果,通过使最终排序列表更稳健来提高排序质量。我们的代码可在\href{https://github.com/XHMY/LLM-RankFusion}{https://github.com/XHMY/LLM-RankFusion}获取。

关键词

引用

@article{arxiv.2406.00231,
  title  = {LLM-RankFusion: Mitigating Intrinsic Inconsistency in LLM-based Ranking},
  author = {Yifan Zeng and Ojas Tendolkar and Raymond Baartmans and Qingyun Wu and Lizhong Chen and Huazheng Wang},
  journal= {arXiv preprint arXiv:2406.00231},
  year   = {2024}
}