AutoRAN:自动劫持大规模推理模型安全推理的框架
机器学习
2026-04-17 v3 密码学与安全
摘要
本文提出 AutoRAN,是首个自动化劫持大规模推理模型(LRM)内部安全推理的框架。AutoRAN 的核心创新在于采用一种执行仿真范式,利用较弱但更不对齐的模型模拟初始劫持尝试的执行推理,并通过利用目标 LRM 拒绝响应中泄露的推理模式进行迭代细化攻击。该方法引导目标模型绕过自身安全警戒系统,详细阐述有害指令。我们在多个基准测试(AdvBench、HarmBench 和 StrongReject)上评估了 AutoRAN,对包括 GPT-o3/o4-mini 和 Gemini-2.5-Flash 在内的 SOTA LRMs 进行测试。结果表明,AutoRAN 在一轮或少数几轮内即可实现接近 100% 的成功率,有效中和即使在由强对齐外部模型评估的推理防御机制。本工作揭示了推理过程本身的透明度创造了一个关键且可被利用的攻击面,凸显了迫切需要保护模型推理痕迹而非仅其最终输出的新型防御措施的紧迫性。
引用
@article{arxiv.2505.10846,
title = {AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models},
author = {Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
journal= {arXiv preprint arXiv:2505.10846},
year = {2026}
}
备注
10 pages, ACL 2026 Main