红队测试Segment Anything模型
计算机视觉与模式识别
2024-04-03 v1 人工智能
机器学习
摘要
基础模型已成为关键工具,通过在大量数据集上预训练并随后针对特定应用微调,解决许多复杂任务。Segment Anything模型是计算机视觉分割任务中最早且最著名的基础模型之一。本文提出多方面的红队测试分析,测试Segment Anything模型应对挑战性任务的能力:(1) 我们分析风格迁移对分割掩码的影响,证明对城市道路仪表板图像应用恶劣天气条件和雨滴会显著扭曲生成的掩码。(2) 我们专注于评估模型是否可用于隐私攻击,例如识别名人面孔,并表明模型在此任务中具有一些不期望的知识。(3) 最后,我们检查模型在文本提示下对分割掩码的对抗攻击的鲁棒性。我们不仅展示了流行的白盒攻击的有效性和对黑盒攻击的抵抗性,还引入了一种新方法——聚焦迭代梯度攻击(FIGA),它结合白盒方法构建高效攻击,导致更少的修改像素。我们所有的测试方法和分析表明,图像分割基础模型需要增强安全措施。
引用
@article{arxiv.2404.02067,
title = {Red-Teaming Segment Anything Model},
author = {Krzysztof Jankowski and Bartlomiej Sobieski and Mateusz Kwiatkowski and Jakub Szulc and Michal Janik and Hubert Baniecki and Przemyslaw Biecek},
journal= {arXiv preprint arXiv:2404.02067},
year = {2024}
}
备注
CVPR 2024 - The 4th Workshop of Adversarial Machine Learning on Computer Vision: Robustness of Foundation Models