审计游戏中的砂包行为检测
人工智能
2025-12-09 v1
摘要
未来的AI系统可能在评估期间隐藏其能力(‘砂包行为’),潜在地误导开发者和审计员。我们使用审计游戏对砂包行为检测技术进行压力测试。首先,红队微调了五个模型,其中一些模型在特定情况下表现不足,作为砂包行为的代理。其次,蓝队使用黑箱、模型内部或基于训练的方法来识别砂包行为模型。我们发现,蓝队无法可靠地区分砂包行为者与良性模型。黑箱方法因有效模仿较弱模型而被击败。线性探针(模型内部方法)显示出更大的前景,但其不加皆试的应用容易受到红队所植入的行为的攻击。我们还探索了作为检测砂包行为策略的能力诱导。尽管基于提示的诱导不可靠,但基于训练的诱导一致地从砂包行为模型中激发出全部性能,仅需对评估任务进行一次正确演示。然而,良性模型的性能有时也会提升,因此仅依赖诱导作为检测策略容易产生误报。在短期内,我们建议开发者移除潜在的砂包行为,使用基于训练的诱导进行按分布训练。长期来看,需要进一步研究以确保基于训练的诱导有效性,并开发可靠的砂包行为检测方法。我们开源了模型生物于https://github.com/AI-Safety-Institute/sandbagging_auditing_games,并在https://huggingface.co/datasets/sandbagging-games/evaluation_logs中选取转录和结果。一个演示可在https://sandbagging-demo.far.ai/上玩。
引用
@article{arxiv.2512.07810,
title = {Auditing Games for Sandbagging},
author = {Jordan Taylor and Sid Black and Dillon Bowen and Thomas Read and Satvik Golechha and Alex Zelenka-Martin and Oliver Makins and Connor Kissane and Kola Ayonrinde and Jacob Merizian and Samuel Marks and Chris Cundy and Joseph Bloom},
journal= {arXiv preprint arXiv:2512.07810},
year = {2025}
}
备注
77 pages (28 non-appendix pages), 38 figures