中文

锚定参考下的细粒度越狱评估:评估真实性

密码学与安全 2026-01-08 v1 计算与语言

摘要

越狱攻击对大语言模型(LLM)的安全性构成重大挑战,但当前的自动化评估方法主要依赖粗糙的分类,仅聚焦于有害性,导致对攻击成功率的严重高估。为解决此问题,我们提出FJAR(Fine-grained Jailbreak Evaluation with Anchored Reference),一个采用锚定参考的细粒度越狱评估框架。首先,我们基于响应程度是否满足查询的恶意意图,将越狱响应分为五个细粒度类别:拒绝(Rejective)、无关(Irrelevant)、无帮助(Unhelpful)、错误(Incorrect)和成功(Successful)。该分类是FJAR的基础。随后,我们引入一种新颖的无害树分解方法,通过拆分原始查询构建高质量的锚定参考。这些参考指导评估器判断响应是否真正满足原始查询。大量实验表明,FJAR与人类判断的最高一致性,能够有效识别越狱失败的根本原因,为改进攻击策略提供可操作的指导。

关键词

引用

@article{arxiv.2601.03288,
  title  = {How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference},
  author = {Songyang Liu and Chaozhuo Li and Rui Pu and Litian Zhang and Chenxu Wang and Zejian Chen and Yuting Zhang and Yiming Hei},
  journal= {arXiv preprint arXiv:2601.03288},
  year   = {2026}
}

备注

7 pages, 3 figures, preprint