通过探针采样加速贪婪坐标梯度及通用提示优化
计算与语言
2024-11-11 v3
摘要
鉴于大语言模型(LLM)的快速发展,其安全性已成为一个关键问题。贪婪坐标梯度(GCG)在构建对抗性提示以突破对齐的 LLM 方面被证明是有效的,但 GCG 的优化非常耗时。为了降低 GCG 的时间成本并启用更全面的 LLM 安全性研究,在本文中,我们研究了一种称为的新算法。该算法的核心是一种动态确定较小的草稿模型对提示候选的预测与目标模型预测相似程度的机制。当目标模型与草稿模型相似时,我们主要依赖草稿模型来过滤掉大量潜在的提示候选。使用 Llama2-7b-chat 时,探针采样实现了高达倍的加速,并在 AdvBench 上取得了相等或更高的攻击成功率(ASR)。此外,探针采样还能够加速其他提示优化技术和对抗方法,使 AutoPrompt 加速,APE 加速,AutoDAN 加速。
引用
@article{arxiv.2403.01251,
title = {Accelerating Greedy Coordinate Gradient and General Prompt Optimization via Probe Sampling},
author = {Yiran Zhao and Wenyue Zheng and Tianle Cai and Xuan Long Do and Kenji Kawaguchi and Anirudh Goyal and Michael Shieh},
journal= {arXiv preprint arXiv:2403.01251},
year = {2024}
}