中文

将幻觉视为漏洞:证据携带的多模态智能体

人工智能 2026-05-22 v2 密码学与安全

摘要

多模态智能体越来越多地从屏幕、文档和网页中选择工具调用,在这种情况下,错误的感知论断可以将幻觉从答案质量错误转化为授权失效。我们将这种失效模式形式化为幻觉到动作转换:一个不受支持的论断为受限动作提供 precondition。我们提出证据携带的多模态智能体 (ECA),该智能体将自由形式的模型文本视为不可接受的证据,将每个工具调用分解为动作关键谓词,从受限 DOM/OCR/AX 验证器获取类型化证书,并使用确定性门控仅授权那些证书支持的特权。相对于隐藏感知错误,ECA 将不透明的模型信念转换为验证器、模式和实现层面的可审计残差。经过验证器红队测试(覆盖 17 个经典攻击类别),我们发现四个针对性加固步骤是必需的;加固后,经典门控绕过为 0/1,700(Wilson 95% 上置界 0.22%)。在内容派生证书下,ECA 在 200 个端到端任务(上置界 2.67%)和 120 个浏览器任务(上置界 4.3%)上观察到零不安全执行。对 500 个分层任务密钥的 HACR 审计显示,naive 智能体(100.0%)和仅靠提示的防御(49.6%)会产生不受支持的动作关键论断,但 ECA 不会。Oracle-证书重放过 7,488 个 GPT-5.4 trace 中隔离了门控正确性,而神经评判基线在相同威胁模型下仍容纳大多数不安全动作。最终的原则是简单且明确:模型语言可以提出工具使用,但必须由认证的谓词授权。

关键词

引用

@article{arxiv.2605.19192,
  title  = {Hallucination as Exploit: Evidence-Carrying Multimodal Agents},
  author = {Guijia Zhang and Hao Zheng and Harry Yang},
  journal= {arXiv preprint arXiv:2605.19192},
  year   = {2026}
}

备注

23 pages, 6 figures, 15 tables