CCFC:面向大语言模型越狱防护的核心与核心-全核心双轨防御
密码学与安全
2025-08-21 v1 人工智能
摘要
越狱攻击对大语言模型(LLM)的安全部署构成了严峻挑战。我们引入了CCFC(Core & Core-Full-Core),这是一种双轨、提示词级别的防御框架,旨在减轻LLM因提示注入和结构感知型越狱攻击而产生的脆弱性。CCFC的运行机制是:首先通过少样本提示隔离用户查询的语义核心,然后使用两条互补的轨道评估该查询:一条是仅核心轨道,用于忽略对抗性干扰(例如,有害后缀或前缀注入);另一条是核心-全核心(CFC)轨道,用于破坏基于梯度或基于编辑的攻击所利用的结构模式。最终响应基于跨两条轨道的安全一致性检查进行选择,从而在不牺牲响应质量的前提下确保鲁棒性。我们证明,与针对强对抗攻击(例如DeepInception、GCG)的最先进防御相比,CCFC将攻击成功率降低了50-75%,同时不影响对良性查询的忠实度。我们的方法持续优于最先进的提示词级别防御,为更安全的LLM部署提供了一种实用且有效的解决方案。
引用
@article{arxiv.2508.14128,
title = {CCFC: Core & Core-Full-Core Dual-Track Defense for LLM Jailbreak Protection},
author = {Jiaming Hu and Haoyu Wang and Debarghya Mukherjee and Ioannis Ch. Paschalidis},
journal= {arXiv preprint arXiv:2508.14128},
year = {2025}
}
备注
11 pages, 1 figure