中文

MEEA:基于 mere exposure效应驱动的对抗性优化用于 LLM Jailbreaking

人工智能 2025-12-23 v1

摘要

大语言模型(LLM)的快速发展加剧了其安全对齐稳健性的关注。虽然现有的越狱研究探索了单轮和多轮策略,但大多数方法隐含地假设安全边界是静态的,且未考虑情境互动如何动态影响模型行为,从而导致稳健性和泛化性有限。针对这一差距,我们提出 MEEA(mere exposure效应攻击),一种受心理学启发的、完全自动化的黑盒框架,用于评估多轮安全稳健性,基于 mere exposure效应。MEEA 利用反复的低毒性语义曝光来逐渐改变模型有效安全阈值的机制,通过持续的互动实现对齐约束的渐进性削弱。具体而言,MEEA 构建语义渐进式提示链,并利用基于语义相似性、毒性和越狱有效性的模拟退火策略进行优化。在封闭源和开源模型(包括 GPT-4、Claude-3.5 和 DeepSeek-R1)上的大规模实验表明,MEEA 在所有模型上均实现了高于七个代表性基线方法的更高攻击成功率,平均攻击成功率提升超过 20%。消融研究进一步验证了退火优化和情境曝光机制的必要性。除提高攻击效果外,我们的发现表明 LLM 安全行为本质上是动态的且依赖历史的,这挑战了常见的静态对齐边界假设,凸显了面向互动的安全评估与防御机制的必要性。我们的代码已公开:https://github.com/Carney-lsz/MEEA

关键词

引用

@article{arxiv.2512.18755,
  title  = {MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking},
  author = {Jianyi Zhang and Shizhao Liu and Ziyin Zhou and Zhen Li},
  journal= {arXiv preprint arXiv:2512.18755},
  year   = {2025}
}