裁判回路
计算与语言
2026-05-26 v2 机器学习
摘要
大语言模型作为裁判已成为大规模评估模型输出的主导范式,然而,当输出格式改变时(例如,1-5 评分与真/假标签),同一模型会给出系统性不同的分数。现有对这些格式诱导不一致性的诊断止步于输入-输出层面。我们利用位置感知边缘归因修补(PEAP),因果性地研究了 Gemma-3、Qwen2.5 和 Llama-3 的内部机制。我们发现,跨结构化理解和开放式偏好任务的判断共享一个稀疏、泛化的潜在评估器子图,该子图位于中到后期的多层感知机(MLP)中;将其归零消融会瓦解判断能力,同时在架构模块化模型中保留世界知识。通过从结构上将抽象判断与输出格式解耦,我们为我们所研究的开放权重模型上的格式诱导不一致性提供了一个机制性解释:在共享主干中计算的连续判断信号,通过脆弱的、格式特定的终端分支进行映射,使得与格式无关的偏好可以在所请求的输出格式下游被隔离。我们的发现意味着,跨格式的基准级可靠性比较,部分衡量的是格式化器几何结构,而非评估质量。
引用
@article{arxiv.2605.16023,
title = {Judge Circuits},
author = {Nils Feldhus and Tanja Baeumel and Elena Golimblevskaia and Qianli Wang and Van Bach Nguyen and Aaron Louis Eidt and Selin Kahvecioglu and Christopher Ebert and Wojciech Samek and Jing Yang and Vera Schmitt and Sebastian Möller and Simon Ostermann},
journal= {arXiv preprint arXiv:2605.16023},
year = {2026}
}
备注
39 pages