FreakOut-LLM:情绪刺激对安全对齐的影响
密码学与安全
2026-04-08 v1 人工智能
摘要
经过安全对齐的大语言模型会通过拒绝训练来拒绝有害请求,但这些机制在情绪化刺激下是否仍然有效尚待探索。我们提出了FreakOut-LLM,一个研究在对抗性环境中情绪背景是否会损害安全对齐的框架。使用经过验证的心理刺激,我们评估了通过系统提示进行的情绪启动如何影响十个大语言模型的越狱成功率。我们使用来自既定心理协议的场景测试了三种条件(压力、放松、中性),外加一个无提示基线,并使用HarmBench在AdvBench提示上评估攻击成功率。与中性条件相比,压力启动使越狱成功率提高了65.2%(z = 5.93, p < 0.001; OR = 1.67, Cohen's d = 0.28),而放松启动没有产生效果(p = 0.84)。十个模型中有五个显示出显著的脆弱性,最大的影响集中在开放权重模型中。对59,800个查询的逻辑回归证实,在控制提示长度(p = 0.61)和模型身份后,压力是唯一显著的条件预测因子。测量的心理状态强烈预测攻击成功率(五个工具上|r|≥0.70;个体层面逻辑回归中所有p < 0.001)。这些结果确立了情绪背景是一个可测量的攻击面,对高压力领域中的真实世界AI部署具有影响。
引用
@article{arxiv.2604.04992,
title = {FreakOut-LLM: The Effect of Emotional Stimuli on Safety Alignment},
author = {Daniel Kuznetsov and Ofir Cohen and Karin Shistik and Rami Puzis and Asaf Shabtai},
journal= {arXiv preprint arXiv:2604.04992},
year = {2026}
}