SNAP:测试捕获条件对基本视觉任务影响的基准
计算机视觉与模式识别
2025-05-22 v1
摘要
深度学习(DL)计算机视觉算法对各种图像扰动的泛化性仍是活跃的研究方向。大多数过往分析聚焦于已采集的图像,而对图像形成管线和环境影响的研究相对不足。本文通过分析捕获条件(如相机参数和照明)对 DL 模型在三个视觉任务(图像分类、目标检测和视觉问答(VQA))上的影响来弥合这一差距。为此,我们评估了常见视觉数据集中的捕获偏差,并构建了一个新基准 SNAP(取自 hutter speed, ISO sesitivity, and erture),包含在受控照明条件下、相机设置密集采样的图像。我们随后评估了众多 DL 视觉模型,展示了捕获条件对每个选定视觉任务的影响。最后,我们进行实验建立 VQA 任务的人类基准。结果表明,计算机视觉数据集存在显著偏差,训练此类数据的模型即使在曝光良好的图像上也无法达到人类水平,且对重大曝光变化和相机设置细微变动都高度敏感。代码与数据可在 https://github.com/ykotseruba/SNAP 访问。
引用
@article{arxiv.2505.15628,
title = {SNAP: A Benchmark for Testing the Effects of Capture Conditions on Fundamental Vision Tasks},
author = {Iuliia Kotseruba and John K. Tsotsos},
journal= {arXiv preprint arXiv:2505.15628},
year = {2025}
}