非你所愿:家庭机器人操作中的排版攻击
密码学与安全
2026-05-19 v1 人工智能
机器人学
摘要
开放词汇的具身智能体越来越依赖诸如 CLIP 的视觉-语言模型进行物体感知与任务 grounding。然而,实现这种灵活性的共享嵌入空间引入了针对排版攻击的结构性脆弱性,即物理场景中的印刷文本在语义上覆盖了视觉判断。尽管先前的工作已在静态 2D 基准和 3D 导航任务中量化了这一威胁,但其对家庭机器人操作完整 Sense-Plan-Act 流程的影响仍未被探索。本工作在基于 Habitat 的模拟中使用 HomeRobot 基准评估了排版攻击。我们引入了一种解耦的感知架构,该架构将冻结的 CLIP 编码器暴露于对抗性贴纸,同时通过 DETIC 维持几何 grounding。在包含 59 个可归因 episode 的受控评估池中,在未控制视角和遮挡且无感知优化的情况下,该攻击实现了 67.8% 的总体攻击成功率(ASR),在完全成功的 episode 中上升至 70.0%。关键在于,我们发现感知错误通过持久的 3D 语义地图传播,导致运动学失败,在此定义为由对抗性投毒的语义状态驱动的对错误物体的物理执行抓取与运输。在这些情况下,机器人物理上抓取错误物体并将其递送至目标容器。这些结果确立了排版误分类是对模块化操作流程安全性的一种真实、可测量且具有物理后果的威胁,而先前的排版攻击研究尚未对此进行考察。
引用
@article{arxiv.2605.18593,
title = {Not What You Asked For: Typographic Attacks in Household Robot Manipulation},
author = {Ali Iranmanesh and Peng Liu},
journal= {arXiv preprint arXiv:2605.18593},
year = {2026}
}
备注
10 pages, 1 figure, IEEE conference format