面向 LLM 控制机器人的语义拒绝服务攻击
密码学与安全
2026-04-29 v1 人工智能
摘要
面向安全的指令遵循本应确保 LLM 控制的机器人安全。我们展示它也创造了一个可用性攻击面。通过注入机器人音频通道中的短型安全合理性短语(1-5 个 token),攻击者可以触发模型的安全推理,从而在不越权模型或覆盖其策略的情况下中止或干扰执行。在具身化环境中,这是一种语义拒绝服务攻击:代理因注入的信号被视为合法警报而停止工作。我们在四个视觉语言模型、七种提示级别防御、三种部署模式以及单注入和多注入设置下进行测试,发现仅凭提示词的防御在抑制攻击与响应真实危险之间进行权衡。最强的防御在某些模型上减少硬性停止攻击成功率,但防御改变了干扰的形式,而非其事实:被抑制的硬性停止重新出现为确认循环和误报,我们通过干扰成功率(DSR)进行测量。我们进一步发现,注入多样性比重复相同短语更有效,这表明模型将多样化的安全线索视为提供证据的证据。实际含义是架构层面的,而非提示级别的:将未经身份验证的音频文本直接路由到 LLM 的系统在安全监控与动作选择之间创建了一个可避免的安全依赖关系。
引用
@article{arxiv.2604.24790,
title = {Semantic Denial of Service in LLM-controlled robots},
author = {Jonathan Steinberg and Oren Gal},
journal= {arXiv preprint arXiv:2604.24790},
year = {2026}
}