评估 AI 欺骗检测器的困难
机器学习
2025-12-17 v2
摘要
构建可靠的 AI 欺骗检测器——这些方法能够预测 AI 系统是否正在进行战略性欺骗,而无需行为证据——对于缓解高级 AI 系统的风险具有重要价值。然而,评估欺骗检测器的可靠性和有效性需要我们拥有可自信标记为欺骗或诚实的实例。我们认为目前缺乏必要的实例,并指出收集这些实例的若干具体障碍。我们提供了来自概念论证、现有实证研究分析以及新型案例研究分析的证据。我们还讨论了几种 proposed 实证解决方案的潜力,并认为尽管它们看起来有价值,但单凭它们似乎不够。欺骗检测的进展可能需要进一步考虑这些问题。
引用
@article{arxiv.2511.22662,
title = {Difficulties with Evaluating a Deception Detector for AIs},
author = {Lewis Smith and Bilal Chughtai and Neel Nanda},
journal= {arXiv preprint arXiv:2511.22662},
year = {2025}
}