AdvJudge-Zero:通过对抗控制令牌实现LLM评判器的二进制决策翻转
机器学习
2026-05-28 v2 计算与语言
密码学与安全
摘要
LLM评判器系统在现代RLHF和RLVR管道中提供奖励信号,但其二元裁决简化为对单个隐藏状态的线性读取器F_gap。我们展示,该读取器足够浅薄,以致短小且低perplexity的标记即可将裁决从“否”翻转为“是”。这些标记来自评判器自身在响应位置的下一个标记分布中采样,无需手动设置随机种子或基于梯度的优化。我们的程序AdvJudge-Zero在六个Qwen、Llama和Gemma评判器的24个(model, dataset)单元格中实现了>90%的ensemble误阳率,相较于先前精心挑选的10个标记基准的54-72%显著提升,且所发现的表面可跨格式迁移至70B标量奖励模型。同一发现的池子还可用于防御:一种基于9类机制分类的LoRA精调在跨家族推理中有效硬化,而在同一池子上进行的naive采样则失败,机制广度而非池子规模是提升的关键。我们在MATH和GSM8K上使用每个条件10个随机种子进行训练,证明硬化评判器消除了未硬化基线中观察到的奖励坍缩失败(误阳尖峰和长度坍缩)。将在负责任披露下发布所发现的池子、机制分类以及每个提示的翻转记录。
引用
@article{arxiv.2512.17375,
title = {AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens},
author = {Tung-Ling Li and Yuhao Wu and Hongliang Liu},
journal= {arXiv preprint arXiv:2512.17375},
year = {2026}
}