通过受控释放提示规避生产环境中的提示警戒
机器学习
2025-10-08 v2 密码学与安全
摘要
随着大型语言模型(LLM)的不断进步,确保AI的安全性和对齐性至关重要。一种流行的方法是使用提示警戒,这些是旨在过滤恶意查询的轻量级机制,易于实现和更新。本文介绍了一种新型攻击,旨在规避此类提示警戒,从而凸显了其局限性。我们的方法在保持响应质量的同时,能够持续性地对生产模型进行越狱,包括Google Gemini(2.5 Flash/Pro)、DeepSeek Chat(DeepThink)、Grok(3)和Mistral Le Chat(Magistral)等高度受保护的聊天界面。该攻击利用提示警戒与主模型之间资源的不对称,通过编码一种轻量级警戒无法解码但主模型能够解码的越狱提示。这揭示了现代LLM架构中轻量级提示警戒固有的攻击面,并强调了从阻止恶意输入转向防止恶意输出的防御的必要性。我们还识别了其他关键的对齐问题,如版权数据提取、训练数据提取以及在思考过程中发生的恶意响应泄露。
引用
@article{arxiv.2510.01529,
title = {Bypassing Prompt Guards in Production with Controlled-Release Prompting},
author = {Jaiden Fairoze and Sanjam Garg and Keewoo Lee and Mingyuan Wang},
journal= {arXiv preprint arXiv:2510.01529},
year = {2025}
}