完成缺失标注:基于多智能体辩论的IR基准准确可扩展相关性评估
计算与语言
2026-02-09 v1 人工智能
摘要
信息检索(Information Retrieval, IR)评估因包含未标记相关块的IR基准数据集而面临挑战。虽然大语言模型(LLM)和LLM-人类混合策略可减少昂贵的人工工作,但仍易产生LLM过度自信和无效的AI-to-human升级问题。为此,我们提出DREAM,一种基于LLM智能体的多轮辩论式相关性评估框架,通过持反对初始立场并进行迭代相互批评的方式实现。我们的基于协议的辩论方法可为某些案例提供更准确的标注,同时为不确定情况提供更可靠的AI-to-human升级路径,仅需3.5%的人工参与即可实现95.2%的标注准确率。使用DREAM,我们构建了BRIDGE基准,旨在缓解评估偏差,使检索器比较更公平,通过发现29,824个缺失的相关块实现。随后我们对IR系统进行再评估,并扩展到RAG评估,表明未解决的空洞不仅扭曲检索器排名,还导致检索-生成不匹配。相关性评估框架已发布于https: //github.com/DISL-Lab/DREAM-ICLR-26;BRIDGE数据集已发布于https://github.com/DISL-Lab/BRIDGE-Benchmark。
引用
@article{arxiv.2602.06526,
title = {Completing Missing Annotation: Multi-Agent Debate for Accurate and Scalable Relevant Assessment for IR Benchmarks},
author = {Minjeong Ban and Jeonghwan Choi and Hyangsuk Min and Nicole Hee-Yeon Kim and Minseok Kim and Jae-Gil Lee and Hwanjun Song},
journal= {arXiv preprint arXiv:2602.06526},
year = {2026}
}
备注
Accepted at ICLR 2026