基于自适应稀疏约束优化的高效 LLM 越狱攻击
机器学习
2025-02-13 v2
摘要
近期研究表明,大型语言模型 (LLM) 对越狱攻击具有高度脆弱性,这些攻击可生成有害内容。本文引入一种新颖的 token 级攻击方法,即自适应稀疏约束优化 (Adaptive Dense-to-Sparse Constrained Optimization, ADC),已被证明可成功越狱多个开源 LLM。我们从离散 token 优化的困难出发, 将离散越狱优化松化为连续优化过程,同时逐渐增加优化向量的稀疏度。这一技术有效弥合了离散与连续空间优化之间的差距。实验结果表明,我们的方法在效果和效率上均优于最先进的 token 级方法。在Harmbench测试中,我们的方法在七个八个 LLM 中实现了最高的攻击成功率。警告: 本文包含可能令人 offense 的模型行为。
引用
@article{arxiv.2405.09113,
title = {Efficient LLM Jailbreak via Adaptive Dense-to-sparse Constrained Optimization},
author = {Kai Hu and Weichen Yu and Yining Li and Kai Chen and Tianjun Yao and Xiang Li and Wenhe Liu and Lijun Yu and Zhiqiang Shen and Matt Fredrikson},
journal= {arXiv preprint arXiv:2405.09113},
year = {2025}
}