自动化欺骗:可扩展的多轮大语言模型越狱
机器学习
2026-03-10 v2 人工智能
摘要
多轮对话攻击利用诸如登门槛(Foot-in-the-Door, FITD)等心理原理,即通过一个小型初始请求为更重要的请求铺平道路,以绕过安全对齐,对大语言模型(LLM)构成持续威胁。针对这些攻击的防御进展受到依赖手动、难以扩展的数据集创建的阻碍。本文提出了一种新颖的自动化流水线,用于生成大规模、基于心理学原理的多轮越狱数据集。我们系统地将FITD技术操作化为可复现的模板,创建了一个涵盖非法活动和冒犯性内容的1500个场景的基准。我们在多轮(有历史)和单轮(无历史)条件下评估了来自三大LLM家族的七个模型。结果揭示了上下文鲁棒性上的显著差异:GPT家族的模型表现出对对话历史的显著脆弱性,攻击成功率(ASR)增加了多达32个百分点。相比之下,Google的Gemini 2.5 Flash表现出卓越的韧性,证明几乎对这些攻击免疫,而Anthropic的Claude 3 Haiku表现出强但不完美的抗性。这些发现凸显了当前安全架构在处理对话上下文方面的关键分歧,并强调了需要能够抵抗叙事操纵的防御措施。
引用
@article{arxiv.2511.19517,
title = {Automating Deception: Scalable Multi-Turn LLM Jailbreaks},
author = {Adarsh Kumarappan and Ananya Mujoo},
journal= {arXiv preprint arXiv:2511.19517},
year = {2026}
}