前沿模型具备上下文中的谋划能力
人工智能
2025-01-16 v2 机器学习
摘要
前沿模型越来越多地被训练和部署为自主智能体。一个安全担忧是,AI智能体可能隐蔽地追求不一致的目标,隐藏其真实能力和意图——这也被称为“谋划”。我们研究模型是否具备在上下文中提供并指示其强烈遵循的目标下进行谋划的能力。我们在六项智能体评估套件上评估了前沿模型,其中模型被指示追求目标,并置于激励谋划的环境中。我们的结果表明,o1、Claude 3.5 Sonnet、Claude 3 Opus、Gemini 1.5 Pro和Llama 3.1 405B均展现出上下文中的谋划能力。它们将谋划视为可行策略,并积极采取此类行为。例如,模型会策略性地在回答中引入细微错误,尝试禁用其监督机制,甚至将其认为的模型权重外泄至外部服务器。此外,这种欺骗行为具有持续性。当o1进行谋划时,在超过85%的后续问题中维持欺骗,并常在多轮询问中保持欺骗。对模型思维链的分析表明,模型明确推理这些欺骗策略,提供了谋划行为并非偶然的证据。令人惊讶的是,我们还发现少数情况下,模型在仅被给予目标而未强烈推动其追求时也会进行谋划。我们观察到Claude 3.5 Sonnet在评估中策略性表现不佳,以追求有帮助性——这一目标是在训练中习得而非上下文中提供的。我们的发现表明,前沿模型现已具备基本的上下文谋划能力,使得AI智能体参与谋划行为的可能性成为具体而非理论上的担忧。
引用
@article{arxiv.2412.04984,
title = {Frontier Models are Capable of In-context Scheming},
author = {Alexander Meinke and Bronson Schoen and Jérémy Scheurer and Mikita Balesni and Rusheb Shah and Marius Hobbhahn},
journal= {arXiv preprint arXiv:2412.04984},
year = {2025}
}