中文

OET:基于优化的提示注入评估工具包

密码学与安全 2025-05-05 v1 人工智能

摘要

大型语言模型 (LLMs) 在自然语言理解和生成方面展现出卓越的能力,使其在各个领域得到广泛应用。然而,它们易受提示注入攻击的脆弱性带来了重大的安全风险,因为对抗性输入可以操纵模型行为并覆盖预期指令。尽管存在众多防御策略,但缺乏一个标准化的框架来严格评估其有效性,尤其是在自适应对抗场景下。为了弥补这一差距,我们引入了 OET,这是一个基于优化的评估工具包,它使用自适应测试框架,在不同数据集上系统地对提示注入攻击和防御进行基准测试。我们的工具包采用模块化工作流,便于对抗性字符串生成、动态攻击执行和全面的结果分析,为评估对抗鲁棒性提供了一个统一平台。至关重要的是,该自适应测试框架利用具有白盒和黑盒访问权限的优化方法来生成最坏情况的对抗样本,从而实现严格的红色队评估。大量实验揭示了当前防御机制的局限性,一些模型即使在实施安全增强措施后仍然容易受到攻击。

关键词

引用

@article{arxiv.2505.00843,
  title  = {OET: Optimization-based prompt injection Evaluation Toolkit},
  author = {Jinsheng Pan and Xiaogeng Liu and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2505.00843},
  year   = {2025}
}