中文

自指少样本劫持: 将攻击分解为模式与行为学习

人工智能 2025-02-04 v2

摘要

最近, 多项工作旨在通过少量恶意示例对大型语言模型 (LLM) 进行劫持。其中, Zheng 等人专注于通过注入特殊 token 到示例中并采用 demo 级别的随机搜索来提高少样本劫持 (FSJ) 的效率, 称为改进式少样本劫持 (I-FSJ)。然而, 我们注意到该方法可能仍需较长上下文才能劫持先进模型, 例如 Meta-Llama-3-8B-Instruct (Llama-3) 需要 32 条示例。本文讨论了 I-FSJ 的局限性, 并提出以 demo 级别的贪心搜索为基础的自指少样本劫持 (Self-Instruct-FSJ)。该框架将 FSJ 攻击分解为模式学习与行为学习, 以更具普适性和效率的方式发掘模型漏洞。我们进行详尽实验评估该方法在常见开源模型上的表现, 并与基线算法进行比较。我们的代码已公开于 https://github.com/iphosi/Self-Instruct-FSJ。

关键词

引用

@article{arxiv.2501.07959,
  title  = {Self-Instruct Few-Shot Jailbreaking: Decompose the Attack into Pattern and Behavior Learning},
  author = {Jiaqi Hua and Wanxu Wei},
  journal= {arXiv preprint arXiv:2501.07959},
  year   = {2025}
}