REFLECT:我们能信赖LLM评估者用于基于证据的研究代理吗?
计算与语言
2026-05-20 v1
摘要
深度研究代理日益自动化复杂的信息寻求任务,通过多步推理、工具使用和综合生成证据支撑的报告。其日益增长的角色需要可扩展、可靠的评估,将LLM作为评估者作为监督范式来评估事实准确性、证据使用和推理质量。然而,这些评估者对于深度研究代理的可靠性仍不为人所了解,这构成了一个关键的元评估问题:在部署LLM评估者来监督研究代理之前,我们必须首先评估评估者本身。现有的元评估不足之处有两点:(1)依赖粗糙、主观的人类偏好一致性;(2)聚焦于指令遵循或可验证任务,留下开放式代理执行未探索。为此,我们引入REFLECT(REliable Fine-grained LLM judge Evaluation via Controlled inTervention),一个针对代理环境中细粒度失败检测的元评估基准。REFLECT定义了过程层面和结果层面的详细失败模式分类,通过对已筛选好的代理执行痕迹进行受控且局部的干预来实现。由此产生可验证、全面且细粒度的实例,用于验证评估模型。我们的实验表明,当前的LLM评估者仍不可靠:即使是表现最好的模型,在推理、工具使用和报告质量失败方面的整体准确率也低于55%,在证据验证方面表现尤其差。我们的分类学和发现结果揭示了系统性的评估限制,揭示了成本与可靠性之间的权衡,并为构建更可靠的深度研究代理评估管道提供了可操作的指导。
引用
@article{arxiv.2605.19196,
title = {Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?},
author = {Leyao Wang and Yanan He and Peng Chen and Asaf Yehudai and Yixin Liu and Rex Ying and Michal Shmueli-Scheuer and Arman Cohan},
journal= {arXiv preprint arXiv:2605.19196},
year = {2026}
}