中文

大型语言模型抵抗人类编写和算法对抗提示的安全性评估

密码学与安全 2025-10-21 v1 人工智能 计算机与社会

摘要

本文对四个主要大型语言模型(LLMs)进行系统性安全评估,以应对多样化的对抗攻击向量。我们评估 Phi-2、Llama-2-7B-Chat、GPT-3.5-Turbo 和 GPT-4,涵盖四种不同的攻击类别:人类编写提示、AutoDAN、Greedy Coordinate Gradient(GCG)和 Tree-of-Attacks-with-pruning(TAP)。我们的全面评估使用来自 SALAD-Bench 数据集的 1,200 个经过细分的提示,涵盖六个伤害类别。结果显示,模型在鲁棒性方面存在显著差异,其中 Llama-2 实现了最高的整体安全性(3.4% 的平均攻击成功率),而 Phi-2 则表现最脆弱(7.0% 的平均攻击成功率)。我们识别出关键的迁移模式,其中 GCG 和 TAP 攻击尽管对其目标模型(Llama-2)无效,但在迁移到其他模型时成功率显著提高(GPT-4 最高可达 17%)。使用 Friedman 检验的统计分析揭示了不同伤害类别之间存在显著差异(p<0.001p < 0.001),其中恶意用途提示显示出最高的攻击成功率(10.71% 的平均率)。我们的发现促进了对跨模型安全漏洞的理解,为开发针对性防御机制提供了可操作的见解。

关键词

引用

@article{arxiv.2510.15973,
  title  = {Safeguarding Efficacy in Large Language Models: Evaluating Resistance to Human-Written and Algorithmic Adversarial Prompts},
  author = {Tiarnaigh Downey-Webb and Olamide Jogunola and Oluwaseun Ajao},
  journal= {arXiv preprint arXiv:2510.15973},
  year   = {2025}
}

备注

10 pages, 4 pages manuscript submitted to the Language Resources and Evaluation Conference (LREC 2026)