对抗性提示评估:对 LLM 提示输入攻击的防护措施系统性基准测试
密码学与安全
2025-02-24 v1 机器学习
摘要
随着大语言模型 (LLM) 被集成到日常应用中,确保其鲁棒性与安全性日益关键。特别是,LLM 可被称为作弊的提示所操纵,导致不安全行为。作弊方式的种类日益增多,迫切需要采用外部防护措施,即防护栏。虽然已提出许多作弊防护方案,但并非所有防护措施都能处理新出现的分布外攻击,因为其防护措施仅针对狭窄的作弊集合进行对齐。此外,围绕防护措施的系统化工作存在显著空白,导致其实际应用中存在重大缺口。本文对 15 种不同防护措施进行系统性基准测试,涵盖广泛的恶意与良性数据集。我们发现,防护措施在不同作弊方式下的性能存在显著差异。此外,我们展示基于当前可用于评估的数据集,简单基准方法可显示出与众多最先进防护措施相当的分布外性能。代码已公开于 https://github.com/IBM/Adversarial-Prompt-Evaluation。
引用
@article{arxiv.2502.15427,
title = {Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs},
author = {Giulio Zizzo and Giandomenico Cornacchia and Kieran Fraser and Muhammad Zaid Hameed and Ambrish Rawat and Beat Buesser and Mark Purcell and Pin-Yu Chen and Prasanna Sattigeri and Kush Varshney},
journal= {arXiv preprint arXiv:2502.15427},
year = {2025}
}
备注
NeurIPS 2024, Safe Generative AI Workshop