一种固定预算、聚类感知的LLM作为评判者评估标准:多跳RAG压力测试
人工智能
2026-05-28 v1 计算与语言
摘要
检索增强生成(RAG)系统通常通过让大型语言模型(LLM)评判者判断哪个答案更好来进行比较。对于多跳RAG,这与其说是一个建模问题,不如说已经成为一个测量问题:相同的分数可能反映检索质量、答案长度、词汇重叠,或者一个忽略聚类数据的统计检验。我们探究当这些选择被明确化时会发生什么。我们提出了一个用于RAG中LLM作为评判者比较的最小测量标准。该标准固定了top-100候选池、证据预算、答案上限、生成器和提示;它还要求预先注册的假设、聚类感知推断、在可行时进行精确的聚类符号翻转检验,以及第二评判者复制。聚类基准测试可能夸大进展;该领域应采用此标准。我们使用遗传算法解码器进行多跳证据组合(GADMEC),一种进化证据选择器,在计算机科学/机器学习(CS/ML)和材料科学领域的400个多跳问题上对其进行了压力测试。该协议改变了实证故事。二项检验使所有四个语义基线比较看起来显著;聚类感知推断只留下一个Bonferroni显著的结果。在相同预算下,BM25优于纯语义GADMEC,而词汇-语义混合方法在CS/ML中恢复了性能,并缩小了材料科学领域的差距。
引用
@article{arxiv.2605.27789,
title = {A Fixed-Budget, Cluster-Aware Standard for LLM-as-a-Judge Evaluation: A Multi-Hop RAG Stress Test},
author = {Camilo Chacón Sartori and José H. García},
journal= {arXiv preprint arXiv:2605.27789},
year = {2026}
}