AttackEval:如何评估针对大型语言模型的越狱攻击的有效性
计算与语言
2025-03-19 v6
摘要
越狱攻击代表了对大型语言模型 (LLMs) 安全性的最复杂威胁之一。为了应对此类风险,我们引入了一种创新框架,有助于评估针对 LLMs 的越狱攻击的有效性。与传统仅关注 LLMs 鲁棒性的二元评估不同,我们的方法评估攻击提示的有效性。我们提出了两种不同的评估框架:粗粒度评估和细粒度评估。每个框架使用 0 到 1 的评分范围,提供独特的视角,并允许在不同场景下评估攻击有效性。此外,我们开发了一个专门为越狱提示量身定制的综合真值数据集。该数据集是我们当前研究的关键基准,并为未来研究提供了基础资源。通过与传统评估方法进行比较,我们的研究表明,当前结果与基线指标一致,同时提供了更细致和细粒度的评估。它还有助于识别在传统评估中可能看似无害的潜在有害攻击提示。总体而言,我们的工作为评估提示注入中更广泛的攻击提示奠定了坚实基础。
引用
@article{arxiv.2401.09002,
title = {AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models},
author = {Dong Shu and Chong Zhang and Mingyu Jin and Zihao Zhou and Lingyao Li and Yongfeng Zhang},
journal= {arXiv preprint arXiv:2401.09002},
year = {2025}
}
备注
Accepted by ACM SIGKDD Explorations 2025