线性探针准确率随模型规模提升并受益于多层集成
机器学习
2026-04-16 v1
摘要
线性探针可检测语言模型输出是否“知道”其错误,这一能力对于欺骗和奖励黑客攻击都具有重要意义。然而,单层探针容易出错:最佳层层次在不同模型和任务之间变化,且在某些欺骗类型中探针会完全失效。我们表明,将来自多个层次的探针组合成集成可在单层探针失效的情况下恢复强大性能,在 Insider Trading 和 Harm-Pressure Knowledge 任务上分别提升 AUROC 达 +29% 和 +78%。在 12 个模型(参数量从 0.5B 到 176B)中,我们发现探针准确率随规模提升:每增加 10 倍参数量提升约 5% AUROC(R=0.81)。从几何学角度看,欺骗方向在不同层次之间逐渐旋转,而非在单一位置出现,这既解释了为何单层探针脆弱,也解释了为何多层集成成功。
引用
@article{arxiv.2604.13386,
title = {Linear Probe Accuracy Scales with Model Size and Benefits from Multi-Layer Ensembling},
author = {Erik Nordby and Tasha Pais and Aviel Parrack},
journal= {arXiv preprint arXiv:2604.13386},
year = {2026}
}