通过多模态域适应防止机器人越狱
机器人学
2025-09-30 v1
摘要
大型语言模型(LLM)和视觉语言模型(VLM)正在机器人环境中广泛部署,但仍面临越狱攻击的威胁,这类攻击可绕过安全机制,导致机器人在现实世界中执行不安全或对人造成物理伤害的行为。数据驱动的防御措施如越狱分类器备受期待,但在数据稀缺的领域难以有效泛化,限制了其在机器人及其他安全关键场景中的实际效果。为此,本文引入 J-DAPT——一种通过注意力融合和域适应实现的轻量级多模态越狱检测框架。J-DAPT 集成文本与视觉嵌入,捕获语义意图与环境 grounding 信息,同时将通用越狱数据集与领域特定参考数据对齐。我们的评估在自动驾驶、海洋机器人和四足动作导航等场景中表明,J-DAPT 将检测准确率提升至接近 100%,且开销最小。这些结果表明,J-DAPT 为保障机器人环境中 VLM 的安全提供了实用解决方案。附录中提供了额外材料:https://j-dapt.github.io。
引用
@article{arxiv.2509.23281,
title = {Preventing Robotic Jailbreaking via Multimodal Domain Adaptation},
author = {Francesco Marchiori and Rohan Sinha and Christopher Agia and Alexander Robey and George J. Pappas and Mauro Conti and Marco Pavone},
journal= {arXiv preprint arXiv:2509.23281},
year = {2025}
}
备注
Project page: https://j-dapt.github.io/. 9 pages, 6 figures