对 LLM 欺骗探针进行压力测试:规模性、鲁棒性与欺骗表征的几何结构
计算与语言
2026-05-28 v1 人工智能
机器学习
摘要
在 LLM 激活上训练的线性探针日益被提议作为欺骗检测指标,然而在干净基准测试中报告的 AUROC 可超过 0.96,而在分布迁移下会崩溃。本文系统性地对探针基准指标进行压力测试,涵盖 Gemma 3 模型系列(1B-27B 参数),诊断其为何会失败,而不仅仅是记录其失败。我们测试了关于欺骗编码的四个假设:(1)单一线性方向、(2)多维子空间、(3)凸锥包、(4)熵代理。我们的设计包括跨域迁移矩阵、多维探针分析配以随机置换 null 基线、熵残差化测试以及 8 种风格迁移下的干扰评估。我们发现:(a)探针在干净数据上实现近完美 AUROC(>=0.998),但在风格迁移下崩溃;风格增强探针在未见风格下恢复近完美检测(平均 AUROC 0.979-0.983);(b)单一方向假设被否定(k=1 仅捕获 0.61-0.80 AUROC),跨域迁移失败被证实为几何性质而非层级不匹配所致;(c)熵代理假设被否定(最大 |rho|=0.454,最大残差化后 Δ-AUROC=0.004);(d)欺骗不构成显著的线性子空间(各域 k*=0),但多维探针(k>=5)通过分布式亚阈值特征恢复信号。探针的脆弱性反映的是分布狭窄性而非架构限制:风格增强探针在 4B 和 27B 参数规模下均实现近乳完美检测,确立逆向规模模式是训练分布 artifacts 而非真正的规模相关现象。
引用
@article{arxiv.2605.27958,
title = {Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations},
author = {Sachin Kumar},
journal= {arXiv preprint arXiv:2605.27958},
year = {2026}
}
备注
Accepted at the GEM Workshop @ ACL 2026