面向公共部门应用的视觉语言模型安全评估框架:构建AI信任
计算机与社会
2025-02-26 v1 计算与语言
计算机视觉与模式识别
摘要
视觉语言模型(VLM)日益被部署于公共部门任务,亟需其安全性和对抗攻击韧性的严格评估。本文提出一种新型框架,量化VLM的对抗风险。我们分析模型在高斯噪声、盐粒噪声和均匀噪声下的表现,识别误分类阈值,推导出复合噪声补丁和显著性图模式,揭示脆弱区域。这些模式与快速梯度符号方法(FGSM)比较,评估其对抗有效性。我们提出新的脆弱性评分,将随机噪声和对抗攻击的影响综合,为评估模型韧性提供全面指标。
引用
@article{arxiv.2502.16361,
title = {A Framework for Evaluating Vision-Language Model Safety: Building Trust in AI for Public Sector Applications},
author = {Maisha Binte Rashid and Pablo Rivas},
journal= {arXiv preprint arXiv:2502.16361},
year = {2025}
}
备注
AAAI 2025 Workshop on AI for Social Impact: Bridging Innovations in Finance, Social Media, and Crime Prevention