通过黑盒到白盒性能提升对欺骗探针进行基准测试
人工智能
2026-01-21 v3 机器学习
摘要
AI助手在回应用户查询时偶尔会进行欺骗性回应。最近,线性分类器(称为“欺骗探针”)被训练来区分语言模型在欺骗性回应与诚实回应期间的内部激活。然而,尚不清楚这些探针在实际检测欺骗方面有多有效,以及是否存在来自希望规避检测的欺骗助手的简单反对策。本文比较了白盒监控(监控器获取到标记级探针激活)与黑盒监控(无此访问权限)。我们通过白盒监控器性能优于黑盒监控器的程度,对欺骗探针进行基准测试,即黑盒到白盒性能提升。我们发现现有欺骗探针存在较弱但鼓舞人心的黑盒到白盒性能提升。
引用
@article{arxiv.2507.12691,
title = {Benchmarking Deception Probes via Black-to-White Performance Boosts},
author = {Avi Parrack and Carlo Leonardo Attubato and Stefan Heimersheim},
journal= {arXiv preprint arXiv:2507.12691},
year = {2026}
}
备注
Preprint. 39 pages, 11 figures, 7 tables