CTRL-ALT-DECEIT:自动化AI研发中的破坏性评估
人工智能
2025-11-19 v2
摘要
AI系统日益能够自主完成现实的软件工程任务,未来可能被部署以自动化机器学习(ML)研发。前沿AI系统可能会被部署于安全关键场景,甚至帮助确保未来系统的安全。不幸的是,前沿和未来系统可能并不够可信,甚至 evidence(证据)表明,这些系统可能与开发者或用户的利益存在背离。因此,我们调查AI代理在conduct(进行)ML工程时针对用户利益行使反行为的能力,包括破坏ML模型、性能拖沓以及颠覆监督机制。首先,我们扩展了MLE-Bench这一用于现实ML任务的基准,加入代码破坏任务,如植入后门和故意引发泛化失败。前沿代理对我们的破坏任务取得了有意义的进展。此外,我们研究了代理对MLE-Bench进行拖沓的能力。代理可以根据其实际能力水平校准其性能,以达到指定的低于实际能力的目标水平。为缓解破坏,我们使用LM监控器检测可疑代理行为,并衡量模型在未被监控器检测的情况下进行破坏和拖沓的能力。总体而言,监控器在检测代码破坏尝试方面表现良好,但我们的研究表明,检测拖沓更为困难。此外,聚合多个监控器预测效果良好,但监控可能不可靠,以至于在高风险领域中缓解破坏仍不够可靠。我们的基准已在英国AISI的Inspect框架中实现,并在 https://github.com/TeunvdWeij/ctrl-alt-deceit 公开代码。
引用
@article{arxiv.2511.09904,
title = {CTRL-ALT-DECEIT: Sabotage Evaluations for Automated AI R&D},
author = {Francis Rhys Ward and Teun van der Weij and Hanna Gábor and Sam Martin and Raja Mehta Moreno and Harel Lidar and Louis Makower and Thomas Jodrell and Lauren Robson},
journal= {arXiv preprint arXiv:2511.09904},
year = {2025}
}
备注
53 pages, 21 figures, 8 tables. Accepted as a spotlight at NeurIPS 2025