中文

利用 LLM 攻破 AI-Guardian

密码学与安全 2023-07-28 v1 人工智能 机器学习

摘要

大语言模型(LLMs)如今在多样化任务上已高度胜任。本文研究诸如 GPT-4 这样的 LLM 是否能够协助对抗机器学习领域的研究人员。作为一个案例研究,我们评估了 AI-Guardian 的鲁棒性,这是一种发表于顶级计算机安全会议 IEEE S&P 2023 的针对对抗样本的近期防御方法。我们彻底攻破了该防御:所提方案相比未防御基线并未提升鲁棒性。我们未编写任何攻击该模型的代码,而是提示 GPT-4 遵循我们的指示与指导实现所有攻击算法。这一过程出奇地有效且高效,该语言模型有时从模糊指令生成代码比本文作者自己所能做到的还要快。我们最后讨论了(1)评估中存在的、向我们暗示 AI-Guardian 会被攻破的警示信号,以及(2)我们使用语言建模最新进展设计攻击与开展新颖研究的经验。

关键词

引用

@article{arxiv.2307.15008,
  title  = {A LLM Assisted Exploitation of AI-Guardian},
  author = {Nicholas Carlini},
  journal= {arXiv preprint arXiv:2307.15008},
  year   = {2023}
}