TRAP:用于黑盒识别的定向随机对抗提示蜜罐
机器学习
2024-06-07 v2 人工智能
计算与语言
密码学与安全
摘要
大型语言模型 (LLM) 服务和模型通常附带关于谁可以使用它们以及如何使用的法律规则。评估已发布 LLM 的合规性至关重要,因为这些规则保护了 LLM 贡献者的利益并防止滥用。在此背景下,我们描述了黑盒身份验证 (Black-box Identity Verification, BBIV) 这一新颖的指纹识别问题。其目标是通过聊天功能确定第三方应用程序是否使用了特定的 LLM。我们提出了一种名为定向随机对抗提示 (Targeted Random Adversarial Prompt, TRAP) 的方法来识别正在使用的特定 LLM。我们重新利用了最初为越狱提出的对抗性后缀,以从目标 LLM 获取预定义的答案,而其他模型则给出随机答案。TRAP 即使在单次交互后,也能以超过 95% 的真阳性率和低于 0.2% 的假阳性率检测目标 LLM。即使 LLM 发生了未显著改变原始功能的微小变化,TRAP 仍然有效。
引用
@article{arxiv.2402.12991,
title = {TRAP: Targeted Random Adversarial Prompt Honeypot for Black-Box Identification},
author = {Martin Gubri and Dennis Ulmer and Hwaran Lee and Sangdoo Yun and Seong Joon Oh},
journal= {arXiv preprint arXiv:2402.12991},
year = {2024}
}
备注
Accepted at ACL 2024 (findings)