中文

经拒绝训练的大语言模型在浏览器代理中容易被越狱

密码学与安全 2024-10-23 v2 机器学习

摘要

出于安全考虑,大语言模型(LLM)被训练以拒绝有害用户指令,例如协助危险活动。本工作研究了一个开放性问题:在非聊天和代理场景中,所需的安全拒绝是否能普遍化?不同于聊天机器人,配备通用工具(如网页浏览器和移动设备)的 LLM 代理能够直接影响现实世界,因此对拒绝有害指令的重要性更高。本文主要关注对浏览器代理进行红队测试,即通过网页浏览器操控信息的 LLM。为此,我们引入了浏览器代理红队工具包(BrowserART),这是一套专为红队测试浏览器代理设计的综合性测试套件。BrowserART 包含 100 个多样化的浏览器相关有害行为(包括原始行为以及来自 HarmBench [Mazeika 等,2024] 和 AirBench 2024 [Zeng 等,2024b] 的行为),覆盖合成网站和真实网站。我们的实证研究揭示,尽管基座 LLM 作为聊天机器人会拒绝有害指令,但相应的代理并非如此。此外,旨在越狱拒绝训练 LLM 的攻击方法在浏览器代理中也能有效传递。结合人类改写,基于 GPT-4o 和 o1-preview 的浏览器代理分别尝试了 98 和 63 个有害行为(均超过 100 个中的 100 个)。我们公开发布 BrowserART,并呼吁 LLM 开发者、政策制定者和代理开发者协作,提高代理的安全性。

关键词

引用

@article{arxiv.2410.13886,
  title  = {Refusal-Trained LLMs Are Easily Jailbroken As Browser Agents},
  author = {Priyanshu Kumar and Elaine Lau and Saranya Vijayakumar and Tu Trinh and Scale Red Team and Elaine Chang and Vaughn Robinson and Sean Hendryx and Shuyan Zhou and Matt Fredrikson and Summer Yue and Zifan Wang},
  journal= {arXiv preprint arXiv:2410.13886},
  year   = {2024}
}