利用定向指令对构建更优欺骗探针
人工智能
2026-02-03 v1 机器学习
摘要
线性探针是监控AI系统欺骗行为的有前景方法。先前工作表明,基于对比指令对和简单数据集训练的线性分类器可实现良好性能。然而,这些探针在简单情境下仍表现出显著失效,包括虚假关联和非欺骗响应的误报。在本文中,我们确定训练时所用指令对的重要性。进一步表明,通过针对人类可解释欺骗分类法进行定向,可在评估数据集上获得更好结果。我们的发现揭示,指令对捕获欺骗意图而非内容特定模式,从而解释了提示选择主导探针性能(占方差70.6%)的原因。鉴于欺骗类型在数据集间的异质性,我们得出结论,组织应针对其特定威胁模型设计专门探针,而非寻求通用欺骗检测器。
引用
@article{arxiv.2602.01425,
title = {Building Better Deception Probes Using Targeted Instruction Pairs},
author = {Vikram Natarajan and Devina Jain and Shivam Arora and Satvik Golechha and Joseph Bloom},
journal= {arXiv preprint arXiv:2602.01425},
year = {2026}
}