面向鲁棒视觉语言模型的方向性嵌入平滑化
机器学习
2026-03-17 v1 人工智能
计算与语言
密码学与安全
摘要
视觉语言模型(VLM)的安全性和可靠性是可信赖代理型 AI 系统部署的关键因素。然而,VLM 仍然容易受到破解攻击,这些攻击会破坏其安全对齐,导致有害输出。本文将 Randomized Embedding Smoothing and Token Aggregation(RESTA)防御机制扩展至 VLM,并针对 JailBreakV-28K 多模态破解攻击基准进行评估。我们发现 RESTA 在减少该多样化攻击成功率方面有效,特别是当采用方向性嵌入噪声时,即注入噪声与原始 token 嵌入向量方向一致时,效果更为显著。我们的结果表明,RESTA 可作为整体安全框架的轻量级推理时防御层,为保障 VLM 在代理系统中的安全提供支持。
引用
@article{arxiv.2603.15259,
title = {Directional Embedding Smoothing for Robust Vision Language Models},
author = {Ye Wang and Jing Liu and Toshiaki Koike-Akino},
journal= {arXiv preprint arXiv:2603.15259},
year = {2026}
}
备注
Accepted at ICLR 2026 Workshop on Agents in the Wild