中文

通过黑盒到白盒性能提升对欺骗探针进行基准测试

人工智能 2026-01-21 v3 机器学习

摘要

AI助手在回应用户查询时偶尔会进行欺骗性回应。最近,线性分类器(称为“欺骗探针”)被训练来区分语言模型在欺骗性回应与诚实回应期间的内部激活。然而,尚不清楚这些探针在实际检测欺骗方面有多有效,以及是否存在来自希望规避检测的欺骗助手的简单反对策。本文比较了白盒监控(监控器获取到标记级探针激活)与黑盒监控(无此访问权限)。我们通过白盒监控器性能优于黑盒监控器的程度,对欺骗探针进行基准测试,即黑盒到白盒性能提升。我们发现现有欺骗探针存在较弱但鼓舞人心的黑盒到白盒性能提升。

关键词

引用

@article{arxiv.2507.12691,
  title  = {Benchmarking Deception Probes via Black-to-White Performance Boosts},
  author = {Avi Parrack and Carlo Leonardo Attubato and Stefan Heimersheim},
  journal= {arXiv preprint arXiv:2507.12691},
  year   = {2026}
}

备注

Preprint. 39 pages, 11 figures, 7 tables