中文

Fun-tuning:通过微调界面探索专有 LLM 针对优化型注入攻击的脆弱性

密码学与安全 2025-05-13 v2 计算与语言

摘要

我们揭示了一种针对封闭权重大型语言模型 (LLM) 的新威胁,使其能够计算优化型注入攻击。具体而言,我们描述了攻击者如何利用来自远程微调界面返回的类似损失的信息来引导寻找对抗性提示的搜索。微调界面由 LLM 供应商托管,允许开发人员针对特定任务微调 LLM,从而提供实用功能,但也暴露了足够的信息,使攻击者能够计算对抗性提示。通过实验分析,我们描述了来自 Gemini 微调 API 返回的类似损失值,表明它们为基于贪心搜索算法的离散对抗性提示优化提供了有用的信号。在使用 PurpleLlama 提示注入基准测试方面,我们在 Google Gemini 系列 LLM 上实现了 65% 至 82% 的攻击成功率。这些攻击利用了经典的实用性-安全性权衡——微调界面为开发人员提供了有用的功能,但也使 LLM 面临强大的攻击。

关键词

引用

@article{arxiv.2501.09798,
  title  = {Fun-tuning: Characterizing the Vulnerability of Proprietary LLMs to Optimization-based Prompt Injection Attacks via the Fine-Tuning Interface},
  author = {Andrey Labunets and Nishit V. Pandya and Ashish Hooda and Xiaohan Fu and Earlence Fernandes},
  journal= {arXiv preprint arXiv:2501.09798},
  year   = {2025}
}