隐形注入:通过隐写术嵌入视觉语言模型
高能物理 - 理论
2025-12-02 v2 高能物理 - 唯象学
摘要
视觉语言模型(VLMs)已彻底变革了多模态 AI 应用,但也引入了尚未充分探讨的新型安全漏洞。我们首次系统性地研究了针对 VLMs 的隐写术提示注入攻击,演示了如何通过高级隐写术技术在图像中隐形嵌入恶意指令。我们的方法表明,当前的 VLM 架构在正常图像处理期间可不经意地提取并执行隐藏的提示,从而导致行为的隐蔽性操控。我们开发了一种多域嵌入框架,结合空间、频率和神经网络隐写术方法,实现了在包括 GPT-4V、Claude 和 LLaVA 等主流 VLMs 上的整体攻击成功率为24.3%(±3.2%,95%置信区间),其中神经网络隐写术方法最高可达31.8%,同时保持合理的视觉隐形性(PSNR 大于 38 dB,SSIM 大于 0.94)。通过在12个多样化数据集和8个前沿模型上的系统评估,我们揭示了当前 VLM 架构存在中等但有意义的脆弱性,并提出了有效的对策。我们的发现对 VLMs 在安全关键型应用中的部署具有重大意义,凸显了需要比例性多模态 AI 安全框架的必要性。
引用
@article{arxiv.2507.22308,
title = {Low-energy multi-photon scattering at tree-level and one-loop order in a homogeneous electromagnetic field},
author = {Ivan Ahumada and Patrick Copinger and James P. Edwards},
journal= {arXiv preprint arXiv:2507.22308},
year = {2025}
}
备注
23 pages; version accepted for publication in Physical Review D