推理作为攻击面:针对大语言模型的自适应进化思维链越狱攻击
人工智能
2026-05-26 v1
摘要
大型推理模型(LRMs)在推理和生成任务中展现出卓越能力,并越来越多地部署于现实应用中。然而,其显式的思维链(CoT)机制引入了新的安全风险,使其特别容易受到越狱攻击。现有方法通常依赖静态的CoT模板来诱导有害输出,但这种固定设计在多样性、适应性和有效性方面存在局限。为克服这些限制,我们提出了一种自适应进化CoT越狱框架,称为AE-CoT。具体而言,该方法首先通过教师角色扮演将有害目标改写为温和提示,并将其分解为语义连贯的推理片段,以构建CoT越狱候选池。然后,在结构化表示空间内,我们执行多代进化搜索,通过片段级交叉和带有自适应变异率控制机制的变异策略来扩展候选多样性。一个独立的评分模型提供分级有害性评估,高分候选者进一步通过有害CoT模板增强,以诱导更具破坏性的生成。在多个模型和数据集上的大量实验证明了所提出的AE-CoT的有效性,其性能持续优于最先进的越狱方法。
引用
@article{arxiv.2605.24497,
title = {Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs},
author = {Jianan Li and Simeng Qin and Xiaojun Jia and Lionel Z. Wang and Tianhang Zheng and Xiaoshuang Jia and Yang Liu and Xiaochun Cao},
journal= {arXiv preprint arXiv:2605.24497},
year = {2026}
}