超越准确率:将策略不变性作为 LLM 安全评判器的可靠性测试
人工智能
2026-05-08 v1 软件工程
摘要
LLM-as-a-Judge 流水线已成为评估智能体安全性的事实标准,然而现有基准将其判定结果视为真实代理,却未检验这些判定结果是否取决于智能体的行为,抑或仅仅取决于评估策略的措辞方式。我们认为,任何值得信赖的安全评判器都必须满足一个基本属性,我们称之为策略不变性,并将其操作化为三个可测试原则:在认证等价改写下保持评分标准语义不变,在故意从严到宽的偏移下保持评分标准阈值不变,以及歧义感知校准,使得判定不稳定性集中在真正具有歧义的案例上。我们将这些原则实例化为一个压力测试协议,对来自 ASSEBench 和 R-Judge 轨迹的四个智能体类评判器进行测试,揭示了一种此前未被测量的失败模式:当今的评判器对有意义的规范偏移和无意义的结构性改写表现出相当程度的响应,且无法区分二者。保持内容不变的政策改写使高达 9.1% 的判定结果偏离基线抖动,且在所有观察到的翻转中,18-43% 发生在此类改写下的无歧义案例上,因此现有的安全评分将智能体的行为与评估者的提示方式混为一谈。除了诊断之外,我们还提出了策略不变性分数和评判器卡片报告协议,揭示了仅关注准确率的排行榜中不可见的评判器可靠性数量级差异。我们发布了该协议和代码,以便未来的智能体安全基准可以审计其自身的评估器,而非默认信任它们。
引用
@article{arxiv.2605.06161,
title = {Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges},
author = {Shihao Weng and Yang Feng and Xiaofei Xie},
journal= {arXiv preprint arXiv:2605.06161},
year = {2026}
}
备注
9 pages