利用通用多提示进行越狱攻击
计算与语言
2025-02-04 v1 人工智能
密码学与安全
机器学习
摘要
近年来,大型语言模型 (LLMs) 发展迅速,彻底改变了各种应用,并显著提升了便利性和生产力。然而,在其令人印象深刻的能力之外,伦理问题和新型攻击(如越狱攻击)也随之出现。大多数提示技术侧重于为个别案例优化对抗性输入,导致在处理大型数据集时计算成本更高。较少有研究关注训练一个可迁移到未见任务的通用攻击者这一更通用的设置。在本文中,我们提出了 JUMP,这是一种基于提示的方法,旨在利用通用多提示对 LLMs 进行越狱攻击。我们还将该方法应用于防御,并将其称为 DUMP。实验结果表明,我们优化通用多提示的方法优于现有技术。
引用
@article{arxiv.2502.01154,
title = {Jailbreaking with Universal Multi-Prompts},
author = {Yu-Ling Hsu and Hsuan Su and Shang-Tse Chen},
journal= {arXiv preprint arXiv:2502.01154},
year = {2025}
}
备注
Accepted by NAACL Findings 2025