JudgeSense:用于评估 LLM 评判系统中提示敏感性的基准
计算与语言
2026-05-11 v2
摘要
大语言模型被广泛用作自动评估评判,但其在语义等价提示重新表述下的裁决稳定性仍未得到充分考察。我们进行系统的经验研究,探讨提示引起的决策不稳定性在多个评估任务和评判架构中的表现。为促进这一分析,我们发布 JudgeSense,一个包含手工验证的提示- paraphrase 对的基准,涵盖事实性、连贯性、相关性和偏好等评估任务,从已建立的 NLP 基准中抽取,并附有详尽的决策日志。该基准实现了衡量等效提示下裁决稳定性的功能,使研究人员能够评估稳定性是否与模型规模或指令调优相关,以及识别哪些任务对提示措辞最敏感。我们的评估显示,连贯性是区分评判行为的主要任务,而事实性裁决在标准条件下表现出高稳定性。成对评估任务始终存在位置偏差。关键的是,我们发现模型规模并非一致性的可靠代理;值得注意的是,我们分析中的最大且最新模型并非最一致的。
引用
@article{arxiv.2604.23478,
title = {JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems},
author = {Rohith Reddy Bellibatlu and Edward Raff and Wenbin Zhang},
journal= {arXiv preprint arXiv:2604.23478},
year = {2026}
}
备注
20 pages, 2 figures, 1 table. Code: https://github.com/rohithreddybc/judgeSense. Dataset (JudgeSense Benchmark): https://huggingface.co/datasets/Rohithreddybc/judgesense-benchmark