中文

使用线性探针检测策略性欺骗

机器学习 2025-02-06 v1

摘要

AI 模型可能将欺骗策略作为策划或错位行为的一部分。仅监控输出是不够的,因为 AI 可能产生看似良性的输出,而其内部推理却是错位的。因此,我们评估线性探针是否可以通过监控模型激活来稳健地检测欺骗。我们测试了两个探针训练数据集,一个包含对比性的诚实或欺骗指令(遵循 Zou 等人,2023),另一个包含对简单角色扮演场景的响应。我们测试这些探针是否能泛化到 Llama-3.3-70B-Instruct 表现出欺骗行为的现实场景中,例如隐瞒内幕交易(Scheurer 等人,2023)和在安全评估中故意表现不佳(Benton 等人,2024)。我们发现,我们的探针在我们的评估数据集上区分诚实和欺骗性响应的 AUROC 介于 0.96 和 0.999 之间。如果我们将决策阈值设定为在与欺骗无关的聊天数据上产生 1% 的假阳性率,我们的探针能捕获 95-99% 的欺骗性响应。总体而言,我们认为白盒探针对于未来的监控系统很有前景,但目前的性能不足以作为对抗欺骗的稳健防御。我们的探针输出可在 data.apolloresearch.ai/dd 查看,代码可在 github.com/ApolloResearch/deception-detection 获取。

关键词

引用

@article{arxiv.2502.03407,
  title  = {Detecting Strategic Deception Using Linear Probes},
  author = {Nicholas Goldowsky-Dill and Bilal Chughtai and Stefan Heimersheim and Marius Hobbhahn},
  journal= {arXiv preprint arXiv:2502.03407},
  year   = {2025}
}

备注

Website: http://data.apolloresearch.ai/dd/ Code: http://www.github.com/ApolloResearch/deception-detection/