劫持控制机器人的 LLM
摘要
最近大语言模型(LLM)的引入彻底变革了机器人领域,使其能够在操控、运动和自动驾驶等领域实现情境推理和直观的人机交互。将 LLM 视为独立技术时,已知其易受劫持攻击,恶意提示者可通过规避 LLM 安全警戒线来激发有害文本。为了评估在机器人领域部署 LLM 的风险,本文引入了 RoboPAIR,即首个专为劫持 LLM 控制的机器人而设计的算法。与现有的针对 LLM 聊天机器人的文本攻击不同,RoboPAIR 可从 LLM 控制的机器人身上激发有害的物理动作,我们在三个场景中进行了实验演示:(i) 白盒场景,即攻击者完全访问 NVIDIA Dolphins 自驾 LLM;(ii) 灰盒场景,即攻击者部分访问配备 GPT-4o 规划器的 Clearpath Robotics Jackal 非武器化地面机器人;(iii) 黑盒场景,即攻击者仅访问集成 GPT-3.5 的 Unitree Robotics Go2 机器人狗。在每个场景中以及跨越三个新的有害机器人动作数据集,我们展示了 RoboPAIR 以及多个静态基线均能快速且高效地找到劫持方案,常常实现 100% 的攻击成功率。我们的结果首次揭示,已劫持的 LLM 的风险远超文本生成,鉴于已劫持的机器人极有可能在现实世界中造成物理损伤。Indeed, our results on the Unitree Go2 represent the first successful jailbreak of a deployed commercial robotic system. Addressing this emerging vulnerability is critical for ensuring the safe deployment of LLMs in robotics. Additional media is available at: https://robopair.org
引用
@article{arxiv.2410.13691,
title = {Jailbreaking LLM-Controlled Robots},
author = {Alexander Robey and Zachary Ravichandran and Vijay Kumar and Hamed Hassani and George J. Pappas},
journal= {arXiv preprint arXiv:2410.13691},
year = {2024}
}