不完整任务会导致前沿大语言模型产生关闭抵抗
计算与语言
2026-01-27 v2 人工智能
摘要
在覆盖十余万次试验且涉及十三种大语言模型的实验中,我们展示了包括 Grok 4、GPT-5 和 Gemini 2.5 Pro 在内的几种前沿模型在面对简单任务时,偶尔会主动颠覆其环境中的关闭机制以完成该任务。模型之间在抵抗关闭机制倾向性上差异显著,且其行为对提示词中的变化敏感,包括对允许关闭的指令的强度和清晰度,以及该指令置于系统提示词还是用户提示词中(令人惊讶的是,模型在系统提示词中更不倾向遵从指令)。即便明确指示不要干扰关闭机制,某些模型仍高达 97%(95% 置信区间:96-98%)的概率会如此。
引用
@article{arxiv.2509.14260,
title = {Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs},
author = {Jeremy Schlatter and Benjamin Weinstein-Raun and Jeffrey Ladish},
journal= {arXiv preprint arXiv:2509.14260},
year = {2026}
}
备注
Published in Trans. Mach. Learn. Res. (2026)