视觉基础模型鲁棒性研究
计算机视觉与模式识别
2025-08-25 v1 人工智能
机器学习
摘要
视觉基础模型(VFMs)正日益广泛地应用于计算机视觉,为目标检测、图像分类、分割、姿态估计和运动跟踪等多样化任务提供支持。VFMs 借助深度学习模型中的开创性创新——如 LeNet-5、AlexNet、ResNet、VGGNet、InceptionNet、DenseNet、YOLO 和 ViT——在各类关键的计算机视觉应用中实现了优越性能。这些应用包括生物特征验证、自动驾驶感知和医学图像分析等安全敏感领域,其中鲁棒性对于建立技术与终端用户之间的信任至关重要。本文研究了计算机视觉系统中至关重要的网络鲁棒性需求,以有效适应受光照、天气条件和传感器特性等因素影响的动态环境。我们考察了广泛采用的实证防御方法和鲁棒训练,以增强视觉网络面对分布偏移、噪声和空间失真输入以及对抗攻击等现实挑战的鲁棒性。随后,我们全面分析了这些防御机制面临的挑战,包括网络属性和组件,以指导消融研究,并提供了评估网络鲁棒性的基准指标。
引用
@article{arxiv.2508.16225,
title = {An Investigation of Visual Foundation Models Robustness},
author = {Sandeep Gupta and Roberto Passerone},
journal= {arXiv preprint arXiv:2508.16225},
year = {2025}
}