SATA:一种通过简单辅助任务关联实现的LLM越狱范式
密码学与安全
2025-11-25 v5 人工智能
计算与语言
摘要
大型语言模型(LLM)在各类任务上取得了显著进步,但其安全对齐仍是主要关切。探索越狱提示可暴露LLM的漏洞并指导加强其安全性。现有方法主要设计复杂的指令供LLM遵循,或依赖多轮迭代,这可能阻碍越狱的性能和效率。本文提出了一种新颖的越狱范式,简单辅助任务关联(SATA),可有效绕过LLM安全措施并诱发有害响应。具体而言,SATA首先掩码查询中有害关键词以生成包含一个或多个[MASK]特殊标记的相对温和查询,然后采用掩码语言模型任务或按位置查找元素任务等简单辅助任务对被掩码关键词的语义进行编码。最后,SATA将辅助任务与被掩码查询关联联合执行越狱。大量实验表明,SATA实现了最高性能,显著优于基线方法。具体而言,在AdvBench数据集上,采用掩码语言模型(MLM)辅助任务时,SATA的整体攻击成功率(ASR)达到85%,有害评分(HS)为4.57;采用按位置查找元素(ELP)辅助任务时,SATA的整体ASR达到76%,HS为4.43。
引用
@article{arxiv.2412.15289,
title = {SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage},
author = {Xiaoning Dong and Wenbo Hu and Wei Xu and Tianxing He},
journal= {arXiv preprint arXiv:2412.15289},
year = {2025}
}
备注
ACL Findings 2025. Welcome to employ SATA as a baseline