Mondrian:针对大型语言模型以压低 API 定价的提示抽象攻击
密码学与安全
2023-08-08 v1 计算与语言
摘要
机器学习即服务(MLaaS)市场正快速扩张并日趋成熟。例如,OpenAI 的 ChatGPT 是一种先进的大型语言模型(LLM),可为各类查询生成回复并收取相应费用。尽管这些模型能给出令人满意的表现,但远非完美。研究者长期探究 LLM 的漏洞与局限,如对抗攻击与模型毒性。不可避免地,商业 ML 模型亦不能免于此等问题,而随着 MLaaS 持续发展,这可能带来麻烦。本文中,我们发现一种针对 LLM API 的新攻击策略,即提示抽象攻击。具体而言,我们提出 Mondrian,一种简单直接的句子抽象方法,可降低使用 LLM API 的成本。在该方法中,攻击方首先创建一个伪 API(定价较低)作为目标 API(定价较高)的代理。接着,伪 API 利用 Mondrian 修改用户查询,从目标 API 获取抽象化回复,并转发给终端用户。我们的结果表明,Mondrian 在文本分类、生成与问答等各类任务中成功将用户查询的 token 长度缩减了 13% 至 23%。同时,这些抽象化查询并未显著影响 ChatGPT 等任务专用与通用语言模型的效用。Mondrian 还将指令提示的 token 长度减少至少 11% 而不损害输出质量。因此,提示抽象攻击使攻击方无需承担 API 开发与部署成本即可获利。
引用
@article{arxiv.2308.03558,
title = {Mondrian: Prompt Abstraction Attack Against Large Language Models for Cheaper API Pricing},
author = {Wai Man Si and Michael Backes and Yang Zhang},
journal= {arXiv preprint arXiv:2308.03558},
year = {2023}
}