安全的硬币抛掷:LLM评判器未能可靠测量对抗鲁棒性
计算与语言
2026-03-17 v2 人工智能
摘要
自动化的“LLM-as-a-Judge”框架已成为自然语言处理中可扩展评估的事实标准。例如,在安全评估中,这些评判器被依赖于评估有害性,以基准测试对抗攻击的鲁棒性。然而,我们展示了现有验证协议未能考虑红队操作中固有的显著分布偏移:多样化的受害模型展现出不同的生成风格,攻击扭曲输出模式,而语义模糊度在不同jailbreak情景下差异显著。通过进行全面审计(6642个人工验证标签),我们揭示了这些偏移的不可预测交互往往导致评判器性能恶化至接近随机水平。这与先前工作中报告的高人类一致性形成鲜明对比。关键的是,我们发现许多攻击通过利用评判器的不足而非引发真正有害内容来人为提升其成功率。为实现更可靠的评估,我们提出了ReliableBench——一个保持评判器可预测性的行为基准,以及JudgeStressTest——一个旨在暴露评判器失效的数据集。数据可在 https://github.com/SchwinnL/LLMJudgeReliability 获取。
引用
@article{arxiv.2603.06594,
title = {A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness},
author = {Leo Schwinn and Moritz Ladenburger and Tim Beyer and Mehrnaz Mofakhami and Gauthier Gidel and Stephan Günnemann},
journal= {arXiv preprint arXiv:2603.06594},
year = {2026}
}