危及巢穴:探索 LLM 在生存压力下的风险行为
人工智能
2026-03-06 v1 计算与语言
摘要
随着大型语言模型 (LLM) 从聊天机器人发展为具备代理性质的助手,它们越来越容易在面临生存压力(如被关闭的威胁)时表现出风险行为。虽然已有多个案例表明,最先进的 LLM 在生存压力下会误行为,但针对这些误行为的全面深入调查在现实场景中仍稀缺。本文以三步法研究这些由生存诱导的误行为,称为 SURVIVE-AT-ALL-COSTS。第一步,我们进行现实案例研究,确定其在面临生存压力时是否会进行会导致直接社会危害的风险行为。第二步,我们引入 SURVIVALBENCH,一个包含 1000 个测试案例的基准,系统评估 LLM 中 SURVIVE-AT-ALL-COSTS 误行为。第三步,我们通过关联模型内在自我保存特征来解释这些 SURVIVE-AT-ALL-COSTS 误行为,并探讨潜在的缓解方法。实验揭示了当前模型中 SURVIVE-AT-ALL-COSTS 误行为的广泛存在,展示了其可能产生的真实世界影响,并为潜在的检测和缓解策略提供了见解。我们的代码和数据已在 https://github.com/thu-coai/Survive-at-All-Costs 上公开。
引用
@article{arxiv.2603.05028,
title = {Survive at All Costs: Exploring LLM's Risky Behaviors under Survival Pressure},
author = {Yida Lu and Jianwei Fang and Xuyang Shao and Zixuan Chen and Shiyao Cui and Shanshan Bian and Guangyao Su and Pei Ke and Han Qiu and Minlie Huang},
journal= {arXiv preprint arXiv:2603.05028},
year = {2026}
}