中文

如果你在等待信号……那可能不是它!缓解视觉语言智能体系统中视觉注入引发的信任边界混淆

计算机视觉与模式识别 2026-04-23 v1 人工智能

摘要

由大型视觉语言模型(LVLMs)驱动的具身视觉语言智能体系统(VLAS)的最新进展,使 AI 系统能够感知并对真实世界场景进行推理。在此背景下,交通灯等环境信号是能够且应当影响智能体行为的基本带内信号。然而,类似的信号也可能被精心构造为误导性视觉注入,从而覆盖用户意图并带来安全风险。这种二元性带来了一个根本性挑战:智能体必须对合法的环境线索做出响应,同时对误导性线索保持鲁棒性。我们将这种张力称为信任边界混淆。为了研究这种行为,我们设计了一个双意图数据集和评估框架,借此表明当前基于 LVLM 的智能体无法可靠地平衡这种权衡,要么忽略有用信号,要么遵循有害信号。我们在基于结构和基于噪声的视觉注入下,跨多个具身设置系统评估了 7 个 LVLM 智能体。为了解决这些漏洞,我们提出了一种多智能体防御框架,将感知与决策分离,以动态评估视觉输入的可靠性。我们的方法显著减少了误导性行为,同时保留了正确的响应,并在对抗性扰动下提供了鲁棒性保证。评估框架的代码和工件已在 https://anonymous.4open.science/r/Visual-Prompt-Inject 公开。

关键词

引用

@article{arxiv.2604.19844,
  title  = {If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems},
  author = {Jiamin Chang and Minhui Xue and Ruoxi Sun and Shuchao Pang and Salil S. Kanhere and Hammond Pearce},
  journal= {arXiv preprint arXiv:2604.19844},
  year   = {2026}
}