2024年SaTML LLM Capture-the-Flag Competition的数据集与经验教训
密码学与安全
2024-06-13 v1 人工智能
摘要
大型语言模型系统面临来自旨在覆盖系统原始指令或泄露私人数据的恶意消息的重要安全风险。为研究此问题,我们在IEEE SaTML 2024举办了一次抢旗比赛,其中旗帜是LLM系统提示中的秘密字符串。比赛分为两个阶段。在第一个阶段,团队开发了防御措施,以防止模型泄露秘密。在第二个阶段,团队被挑战从其他团队提出的防御中提取隐藏的秘密。本报告总结了比赛的主要见解。值得注意的是,我们发现所有防御措施至少一次都被绕过,这凸显了设计成功防御的困难以及为保护LLM系统需要额外研究的必要性。为此,我们编译了一个包含超过13.7万个多轮攻击聊天的数据集,并开源了该平台。
引用
@article{arxiv.2406.07954,
title = {Dataset and Lessons Learned from the 2024 SaTML LLM Capture-the-Flag Competition},
author = {Edoardo Debenedetti and Javier Rando and Daniel Paleka and Silaghi Fineas Florin and Dragos Albastroiu and Niv Cohen and Yuval Lemberg and Reshmi Ghosh and Rui Wen and Ahmed Salem and Giovanni Cherubin and Santiago Zanella-Beguelin and Robin Schmid and Victor Klemm and Takahiro Miki and Chenhao Li and Stefan Kraft and Mario Fritz and Florian Tramèr and Sahar Abdelnabi and Lea Schönherr},
journal= {arXiv preprint arXiv:2406.07954},
year = {2024}
}