中文

基于 LLM 的相关性判定中提示敏感性的 Human-AI 比较分析

信息检索 2025-04-18 v1 计算与语言

摘要

大型语言模型(LLMs)正日益被用于自动化信息检索(IR)任务的相关性判定,其与人类标签的一致性通常接近人类间的一致性。为评估基于 LLM 的相关性判定的鲁棒性与可靠性,我们系统性地研究了提示敏感性对该任务的影响。我们从 15 位人类专家和 15 个 LLM 中收集了三种任务——二元判定、分级判定和成对判定——的相关性评估提示,共获得 90 个提示。在剔除了来自 3 位人类和 3 个 LLM 的不可用提示后,我们使用剩余的 72 个提示,以三个不同的 LLM 作为判定者,对来自两个 TREC Deep Learning 数据集(2020 和 2021)的文档/查询对进行标注。我们使用 Cohen's κ\kappa 和成对一致性度量将 LLM 生成的标签与 TREC 官方人类标签进行了比较。除了研究提示变化对与人类标签一致性的影响外,我们还比较了人类生成的提示与 LLM 生成的提示,并分析了不同 LLM 作为判定者时的差异。我们还将人类生成的提示和 LLM 生成的提示与 Bing 和 TREC 2024 检索增强生成(RAG)赛道用于相关性评估的标准 UMBRELA 提示进行了比较。为支持未来基于 LLM 的评估研究,我们在 https://github.com/Narabzad/prompt-sensitivity-relevance-judgements/ 上发布了所有数据和提示。

关键词

引用

@article{arxiv.2504.12408,
  title  = {A Human-AI Comparative Analysis of Prompt Sensitivity in LLM-Based Relevance Judgment},
  author = {Negar Arabzadeh and Charles L. A . Clarke},
  journal= {arXiv preprint arXiv:2504.12408},
  year   = {2025}
}