中文

双模态多阶段对抗安全训练:强化多模态网页智能体抵御跨模态攻击

机器学习 2026-03-05 v1 人工智能 计算与语言

摘要

能够处理屏幕截图和可访问性树两种信息的多模态网页智能体日益被部署以与网页界面交互,但其双流架构开辟了一个充满未探索攻击面的风险:对手通过向网页 DOM 中注入内容,同时在两个观察通道上实施一致的欺骗性叙事。我们的漏洞分析表明,包含视觉成分的攻击远超仅注入文本的攻击,暴露了以文本为中心的视觉语言模型安全训练中的关键缺口。基于此发现,我们提出了双模态多阶段对抗安全训练(Dual-Modality Multi-Stage Adversarial Safety Training, DMAST),该框架将智能体-攻击者交互形式化为二维零和马尔可夫游戏,通过三阶段管道协同训练双方:(1)从强教师模型进行模仿学习,(2)采用新颖的零确认策略进行 oracle 指导的监督微调,以在对抗噪声下锻炼任务聚焦推理,(3)通过群相对政策优化(GRPO)进行对抗强化学习。在离分布任务上,DMAST 显著缓解了对抗风险,同时将任务完成效率提升了一倍。我们的方法显著优于既有的基于训练和基于提示的防御措施,展示了真正的共演进进展,并对复杂、未知环境实现了稳健的泛化。

关键词

引用

@article{arxiv.2603.04364,
  title  = {Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks},
  author = {Haoyu Liu and Dingcheng Li and Lukas Rutishauser and Zeyu Zheng},
  journal= {arXiv preprint arXiv:2603.04364},
  year   = {2026}
}