Checkpoint-GCG: 审计与攻击基于微调的提示注入防御
密码学与安全
2025-10-17 v2 人工智能
计算与语言
机器学习
摘要
大语言模型 (LLM) 越来越多地部署于聊天机器人和智能体系统等实际应用中,预期其处理不可信数据并遵循可信指令。无法区分二者会带来显著的安全风险,被提示注入攻击所利用——该攻击将恶意指令注入数据中以控制模型输出。已提出模型级防御以缓解提示注入攻击。这些防御通过微调 LLM 来忽略不可信数据中的注入指令。我们引入 Checkpoint-GCG,一种针对基于微调防御的白盒攻击。Checkpoint-GCG 通过利用微调过程中产生的中间模型检查点来初始化 GCG,增强了贪婪坐标梯度 (GCG) 攻击,每个检查点作为下一个检查点的跳板以持续改进攻击。首先,我们在审计设置中实例化 Checkpoint-GCG 以评估最先进防御的鲁棒性,假设 (a) 完全了解模型输入且 (b) 可访问中间模型检查点。我们表明 Checkpoint-GCG 对最强防御实现了高达 96% 的攻击成功率 (ASR)。其次,我们放宽第一个假设,搜索一个适用于未见输入的通用后缀,针对最强防御获得了高达 89.9% 的 ASR。最后,我们放宽两个假设,搜索一个可迁移至类似黑盒模型和防御的通用后缀,针对 Meta 新发布的防御模型实现了 63.9% 的 ASR。
引用
@article{arxiv.2505.15738,
title = {Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses},
author = {Xiaoxue Yang and Bozhidar Stevanoski and Matthieu Meeus and Yves-Alexandre de Montjoye},
journal= {arXiv preprint arXiv:2505.15738},
year = {2025}
}