防御 Gemini 免受间接提示注入的经验
密码学与安全
2025-05-21 v1 机器学习
摘要
Gemini 越来越多地被用于代表用户执行任务,其函数调用和工具使用能力使模型能够访问用户数据。然而,某些工具需要访问不可信数据,从而引入了风险。攻击者可以在不可信数据中嵌入恶意指令,导致模型偏离用户的期望并错误处理其数据或权限。在本报告中,我们阐述了 Google DeepMind 评估 Gemini 模型对抗鲁棒性的方法,并描述了从该过程中获得的主要经验。我们通过一个对抗性评估框架测试了 Gemini 在面对复杂攻击者时的表现,该框架部署了一套自适应攻击技术,持续针对 Gemini 的过去、当前和未来版本运行。我们描述了这些持续的评估如何直接帮助提高 Gemini 抵御操纵的能力。
引用
@article{arxiv.2505.14534,
title = {Lessons from Defending Gemini Against Indirect Prompt Injections},
author = {Chongyang Shi and Sharon Lin and Shuang Song and Jamie Hayes and Ilia Shumailov and Itay Yona and Juliette Pluto and Aneesh Pappu and Christopher A. Choquette-Choo and Milad Nasr and Chawin Sitawarin and Gena Gibson and Andreas Terzis and John "Four" Flynn},
journal= {arXiv preprint arXiv:2505.14534},
year = {2025}
}