EquaCode:基于方程求解与代码补全的大语言模型多策略越狱攻击方法
密码学与安全
2025-12-30 v1 人工智能
摘要
诸如 ChatGPT 等大语言模型(LLM)在众多领域取得了显著成功。然而,其可信度仍是一个重要隐患,因为它们仍易受旨在诱导不当或有害响应的越狱攻击。然而,现有的越狱攻击主要在自然语言层面运作,并依赖单一攻击策略,这限制了其全面评估 LLM 鲁棒性的有效性。在本文中,我们提出了 EquaCode,一种基于方程求解与代码补全的新型大语言模型多策略越狱方法。该方法将恶意意图转化为数学问题,随后要求 LLM 使用代码求解,利用跨领域任务的复杂性将模型注意力转移至任务完成而非安全约束。实验结果表明,EquaCode 在 GPT 系列上实现了 91.19% 的平均成功率,在 3 个最先进的 LLM 上实现了 98.65% 的成功率,且均仅需单次查询。此外,消融实验表明,EquaCode 优于单独使用数学方程模块或代码模块。这表明存在强烈的协同效应,从而证明多策略方法的效果大于各部分之和。
引用
@article{arxiv.2512.23173,
title = {EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion},
author = {Zhen Liang and Hai Huang and Zhengkui Chen},
journal= {arXiv preprint arXiv:2512.23173},
year = {2025}
}
备注
This is a preprint. A revised version will appear in the Proceedings of AAAI 2026