中文

Likert 还是不要 Likert:LLM 在细粒度有序量表上的绝对相关性判定

机器学习 2025-05-27 v1 信息检索

摘要

大型语言模型(LLM)在各种信息检索任务上取得了 SOTA 的零样本相关性排序性能。引导 LLM 进行相关性判定的两种最常见提示方式是逐点打分(又称相关性生成),即 LLM 观察单个查询-文档对并输出单个相关性分数;以及列表排序(又称排列生成),即 LLM 观察一个查询和一组文档列表并输出一个排列,按相关性递减顺序对文档进行排序。当前研究界的共识是列表排序能产生更优的性能,且大量研究工作致力于精心设计 LLM 列表排序算法。其潜在假设是 LLM 在做出相对相关性判定方面优于绝对相关性判定。与该假设相矛盾的是,我们发现当使用足够大的有序相关性标签空间来实现逐点打分时,逐点打分与列表排序之间的差距会缩小,并且在许多 LLM-基准数据集组合上变得在统计上不显著(其中“显著”意味着“有 95% 的置信度认为列表排序能提升 NDCG@10”)。我们的评估涵盖了四个 LLM、来自 BEIR 和 TREC-DL 套件的八个基准数据集,以及两个专有数据集,这些数据集的相关性标签均在所有受评 LLM 的训练截止日期之后收集。

关键词

引用

@article{arxiv.2505.19334,
  title  = {Likert or Not: LLM Absolute Relevance Judgments on Fine-Grained Ordinal Scales},
  author = {Charles Godfrey and Ping Nie and Natalia Ostapuk and David Ken and Shang Gao and Souheil Inati},
  journal= {arXiv preprint arXiv:2505.19334},
  year   = {2025}
}