中文

评判可靠性编件:对LLM评判器可靠性进行压力测试

人工智能 2026-03-06 v1

摘要

我们提出Judge Reliability Harness,一个开源库,用于构建验证套件来测试LLM评判器的可靠性。由于LLM-based评打分在AI基准测试中广泛部署,仍需要更多工具来高效评估这些方法的可靠性。给定基准数据集和LLM评判器配置,编件会生成可靠性测试,评估自由响应和代理任务格式中的二元判断准确性和序数评分性能。我们在四个基准测试上评估了四个最先进的评判器,涵盖安全、说服、滥用和代理行为领域,发现不同模型和扰动类型的性能存在显著差异,这凸显了提高LLM评判器鲁棒性的机遇。我们评估的任何评判器在我们编件使用的基准测试中都不具备统一的可靠性。例如,我们在评判器上的初步实验揭示了由于简单文本格式更改、改写、 verbosity(语篇长度)变化以及翻转LLM生成响应中的ground truth标签而导致的一致性问题。

关键词

引用

@article{arxiv.2603.05399,
  title  = {Judge Reliability Harness: Stress Testing the Reliability of LLM Judges},
  author = {Sunishchal Dev and Andrew Sloan and Joshua Kavner and Nicholas Kong and Morgan Sandler},
  journal= {arXiv preprint arXiv:2603.05399},
  year   = {2026}
}

备注

Accepted at Agents in the Wild: Safety, Security, and Beyond Workshop at ICLR 2026 - April 26, 2026, Rio de Janeiro, Brazil