中文

当 LLMs 产生分歧时:诊断 SDG 搜索中的相关性过滤偏差与检索分歧

信息检索 2025-07-04 v1 人工智能 数字图书馆

摘要

大型语言模型(LLMs)在信息检索流程中越来越多地被用于分配文档相关性标签,尤其是在缺乏人工标注数据的领域。然而,不同的模型在边界情况上往往存在分歧,这引发了关于此类分歧如何影响下游检索的担忧。本研究检查了两个开放权重 LLMs(LLaMA 和 Qwen)在关于可持续发展目标(SDGs) 1、3 和 7 的学术摘要语料库上的标注分歧。我们分离出分歧子集,并检查了它们的词汇属性、排序行为和分类可预测性。我们的结果表明,模型分歧是系统性的,而非随机的:分歧案例表现出一致的词汇模式,在共享评分函数下产生分歧的最高排名输出,并且使用简单的分类器即可达到 0.74 以上的 AUC 将其区分开来。这些发现表明,基于 LLM 的过滤在文档检索中引入了结构化的变异性,即使在受控提示和共享排序逻辑下也是如此。我们提出将分类分歧作为检索评估中的分析对象,特别是在政策相关或主题搜索任务中。

关键词

引用

@article{arxiv.2507.02139,
  title  = {When LLMs Disagree: Diagnosing Relevance Filtering Bias and Retrieval Divergence in SDG Search},
  author = {William A. Ingram and Bipasha Banerjee and Edward A. Fox},
  journal= {arXiv preprint arXiv:2507.02139},
  year   = {2025}
}

备注

Presented at LLM4Eval Workshop, SIGIR 2025 Padova, Italy, July 17, 2025