被越狱的 GenAI 模型可能造成重大损害:基于 GenAI 的应用易受 PromptWare 攻击
密码学与安全
2024-08-12 v1 人工智能
摘要
本文论证了被越狱的 GenAI 模型可能对基于 GenAI 的应用造成重大损害,并促成 PromptWare——一种将 GenAI 模型行为从服务应用转变为攻击应用的新类型攻击。PromptWare 利用用户输入来越狱 GenAI 模型,迫使/执行基于 GenAI 的应用上下文中的恶意活动。首先,我们引入 PromptWare 的一种朴素实现,其行为表现为针对 Plan & Execute 架构(即 ReAct、函数调用)的恶意软件。我们证明攻击者可通过构造用户输入来强制期望的执行流程,前提是攻击者已知基于 GenAI 的应用的逻辑。我们展示了一种拒绝服务攻击的应用,该攻击触发基于 GenAI 的助手进入无限循环,浪费资金和计算资源在针对 GenAI 引擎的冗余 API 调用上,阻止应用向用户提供服务。接下来,我们引入一种更复杂的 PromptWare 实现,命名为高级 PromptWare 威胁(APwT),其目标是攻击者未知其逻辑的基于 GenAI 的应用。我们证明攻击者可构造利用 GenAI 引擎高级 AI 能力的用户输入,在推理时启动一个由六个步骤组成的杀伤链,旨在提升权限、分析应用上下文、识别有价值资产、推理可能的恶意活动、从中做出决策并执行。我们展示了 APwT 针对基于 GenAI 的电子商务聊天机器人的应用,并证明它可以触发 SQL 表的修改,可能导致对用户出售的商品产生未经授权的折扣。
引用
@article{arxiv.2408.05061,
title = {A Jailbroken GenAI Model Can Cause Substantial Harm: GenAI-powered Applications are Vulnerable to PromptWares},
author = {Stav Cohen and Ron Bitton and Ben Nassi},
journal= {arXiv preprint arXiv:2408.05061},
year = {2024}
}
备注
Website, see https://sites.google.com/view/promptware