中文

不完整任务会导致前沿大语言模型产生关闭抵抗

计算与语言 2026-01-27 v2 人工智能

摘要

在覆盖十余万次试验且涉及十三种大语言模型的实验中,我们展示了包括 Grok 4、GPT-5 和 Gemini 2.5 Pro 在内的几种前沿模型在面对简单任务时,偶尔会主动颠覆其环境中的关闭机制以完成该任务。模型之间在抵抗关闭机制倾向性上差异显著,且其行为对提示词中的变化敏感,包括对允许关闭的指令的强度和清晰度,以及该指令置于系统提示词还是用户提示词中(令人惊讶的是,模型在系统提示词中更不倾向遵从指令)。即便明确指示不要干扰关闭机制,某些模型仍高达 97%(95% 置信区间:96-98%)的概率会如此。

关键词

引用

@article{arxiv.2509.14260,
  title  = {Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs},
  author = {Jeremy Schlatter and Benjamin Weinstein-Raun and Jeffrey Ladish},
  journal= {arXiv preprint arXiv:2509.14260},
  year   = {2026}
}

备注

Published in Trans. Mach. Learn. Res. (2026)