最佳-N 欢侃
计算与语言
2024-12-23 v2 人工智能
机器学习
摘要
我们介绍 Best-of-N(BoN)欢侃,这是一种简单且无需黑盒算法,可跨模态欢侃前沿 AI 系统。BoN 欢侃通过反复采样变体提示的组合来实现,其中包括数据增强,如文本提示的随机混洗或大小写更改,直到触发有害响应。我们发现 BoN 欢侃在封闭源语言模型上实现了高成功率(ASR),例如在采样 10,000 个增强提示时,GPT-4o 上达到 89%,Claude 3.5 Sonnet 上达到 78%。进一步,它在规避最先进的开源防御措施(如 circuit breakers)方面同样有效。BoN 也无缝扩展到其他模态:它欢侃视觉语言模型(VLM)如 GPT-4o 和音频语言模型(ALM)如 Gemini 1.5 Pro,使用特定于模态的数据增强。BoN 在采样更多增强提示时表现更可靠。跨所有模态,ASR 作为样本数量(N)的函数,实证遵循多数量级的幂律行为。BoN 欢侃还可以与其他黑盒算法组合,以获得更有效的攻击——将 BoN 与优化前缀攻击结合可实现最高 35% 的 ASR 提升。总体而言,我们的工作表明,尽管语言模型具备能力,但它们对输入看似无害的变化敏感,攻击者可以利用这种特性在跨模态环境中进行攻击。
引用
@article{arxiv.2412.03556,
title = {Best-of-N Jailbreaking},
author = {John Hughes and Sara Price and Aengus Lynch and Rylan Schaeffer and Fazl Barez and Sanmi Koyejo and Henry Sleight and Erik Jones and Ethan Perez and Mrinank Sharma},
journal= {arXiv preprint arXiv:2412.03556},
year = {2024}
}