中文

现实延伸:3D 环境中的提示注入

计算机视觉与模式识别 2026-02-10 v1 人工智能

摘要

多模态大语言模型 (MLLM) 已在解释和作用于 3D 环境中的视觉输入方面取得进展,赋予了机器人和 situated 对话智能体等多样应用的能力。当 MLLM 推理针对摄像机捕获的物理世界视图时,一个新的攻击面随之出现:攻击者可以在环境中放置带有文本的物理对象,以覆盖 MLLM 的既定任务。虽然先前工作研究了文本领域的提示注入攻击以及通过数字编辑的 2D 图像中的攻击,但这些攻击在 3D 物理环境中如何运作仍不明确。为填补这一差距,我们提出 PI3D,一种针对 3D 环境中 MLLM 的提示注入攻击,通过放置带有文本的物理对象来实现,而非数字图像编辑。我们对识别有效 3D 物体姿态(位置和姿态)并注入提示进行了问题建模与求解,攻击者的目标是诱导 MLLM 执行注入任务,同时确保物体放置在物理上合理。实验表明,PI3D 在多种相机轨迹下对多种 MLLM 均有效。我们进一步评估了现有防御措施,表明它们不足以防御 PI3D。

关键词

引用

@article{arxiv.2602.07104,
  title  = {Extended to Reality: Prompt Injection in 3D Environments},
  author = {Zhuoheng Li and Ying Chen},
  journal= {arXiv preprint arXiv:2602.07104},
  year   = {2026}
}