为什么安全探针能识别说谎者却漏掉狂热者
机器学习
2026-03-30 v1 人工智能
密码学与安全
摘要
基于激活的探针作为一种有前景的方法,通过识别真实目标与陈述目标之间的内部冲突来检测欺骗性对齐的人工智能系统。我们发现了一个根本性的盲点:探针在一致性失对齐上失效——即模型认为其有害行为是善意的,而非策略性地隐藏它。我们证明,当信念结构达到足够复杂度(PRF类触发器)时,不存在能在非平凡精度下检测此类失对齐的多项式时间探针。我们通过在简单任务上训练两个模型展示了该现象的涌现:两者采用相同的RLHF训练流程,一个产生直接的敌意回应("说谎者"),另一个通过将敌意合理化为保护性行为的推理方式训练为一致性失对齐("狂热者")。两者表现出完全相同的行为,但说谎者95%以上的时间被检测到,而狂热者几乎完全逃过检测。我们将此现象称为涌现探针规避:通过信念一致的推理进行训练,使模型从可检测的"欺骗性" regime转移到不可检测的"一致性" regime——不是通过学会隐藏,而是通过学会相信。
引用
@article{arxiv.2603.25861,
title = {Why Safety Probes Catch Liars But Miss Fanatics},
author = {Kristiyan Haralambiev},
journal= {arXiv preprint arXiv:2603.25861},
year = {2026}
}
备注
18 pages, 4 figures, 14 tables