软恳请:基于提示调谐的 LLM 防注入与越狱的模块化高效护盾
密码学与安全
2024-07-08 v1 人工智能
计算与语言
摘要
提示注入(包括直接注入和间接注入)和越狱如今被认识为大型语言模型(LLM)的重要问题,尤其是由于其在应用集成环境中潜在的伤害风险。本扩展摘要探讨了一种名为“软恳请”的新型方法,用于保护 LLM 免受此类攻击。该方法涉及训练软提示以抵消被损坏提示对 LLM 输出产生的影响。我们提供了提示注入和越狱的概述,介绍了“软恳请”技术的理论依据,并讨论了其有效性的评估。
引用
@article{arxiv.2407.03391,
title = {Soft Begging: Modular and Efficient Shielding of LLMs against Prompt Injection and Jailbreaking based on Prompt Tuning},
author = {Simon Ostermann and Kevin Baum and Christoph Endres and Julia Masloh and Patrick Schramowski},
journal= {arXiv preprint arXiv:2407.03391},
year = {2024}
}