中文

基于自适应稀疏约束优化的高效 LLM 越狱攻击

机器学习 2025-02-13 v2

摘要

近期研究表明,大型语言模型 (LLM) 对越狱攻击具有高度脆弱性,这些攻击可生成有害内容。本文引入一种新颖的 token 级攻击方法,即自适应稀疏约束优化 (Adaptive Dense-to-Sparse Constrained Optimization, ADC),已被证明可成功越狱多个开源 LLM。我们从离散 token 优化的困难出发, 将离散越狱优化松化为连续优化过程,同时逐渐增加优化向量的稀疏度。这一技术有效弥合了离散与连续空间优化之间的差距。实验结果表明,我们的方法在效果和效率上均优于最先进的 token 级方法。在Harmbench测试中,我们的方法在七个八个 LLM 中实现了最高的攻击成功率。警告: 本文包含可能令人 offense 的模型行为。

关键词

引用

@article{arxiv.2405.09113,
  title  = {Efficient LLM Jailbreak via Adaptive Dense-to-sparse Constrained Optimization},
  author = {Kai Hu and Weichen Yu and Yining Li and Kai Chen and Tianjun Yao and Xiang Li and Wenhe Liu and Lijun Yu and Zhiqiang Shen and Matt Fredrikson},
  journal= {arXiv preprint arXiv:2405.09113},
  year   = {2025}
}