AgentTypo:针对黑箱多模态智能体的自适应打字注射攻击
密码学与安全
2025-10-07 v1 人工智能
摘要
建立在大型视觉语言模型 (LVLMs) 之上的多模态智能体正在越来越多地部署于开放世界环境中,但仍高度易受到视觉输入形式的提示注入攻击.我们引入AgentTypo,一个黑箱红队测试框架,通过在网页图像中嵌入优化文本来发起自适应打字注射攻击.我们的自动化打字注射 (ATPI) 算法通过替换标注者来最大化提示重建,同时通过隐形损失最小化人类可检测性,以Tree结构Parzen估计器引导文本位置、大小和颜色的黑箱优化.为进一步增强攻击强度,我们开发了AgentTypo-pro,一个多LLM系统,用于通过评估反馈迭代细化注入提示,并检索成功的过去实例以实现持续学习.有效提示被抽象为可通用的策略并存储在策略存储库中,以实现知识的渐进式积累和在未来攻击中的重用.在Classifieds、Shopping和Reddit场景下的VWA-Adv基准测试中,AgentTypo显著优于最新的基于图像的攻击如AgentAttack.在GPT-4o智能体上,仅通过图像的攻击将成功率从0.23提高到0.45,在GPT-4V、GPT-4o-mini、Gemini 1.5 Pro和Claude 3 Opus上均显示出一致结果.在图像+文本设置下,AgentTypo实现0.68的ASR,也优于最新的基线.我们的发现表明,AgentTypo对多模态智能体构成实际且强大的威胁,并凸显了迫切需要有效防御的重要性.
引用
@article{arxiv.2510.04257,
title = {AgentTypo: Adaptive Typographic Prompt Injection Attacks against Black-box Multimodal Agents},
author = {Yanjie Li and Yiming Cao and Dong Wang and Bin Xiao},
journal= {arXiv preprint arXiv:2510.04257},
year = {2025}
}
备注
13 pages, 8 figures. Submitted to IEEE Transactions on Information Forensics & Security