中文

SNAP:测试捕获条件对基本视觉任务影响的基准

计算机视觉与模式识别 2025-05-22 v1

摘要

深度学习(DL)计算机视觉算法对各种图像扰动的泛化性仍是活跃的研究方向。大多数过往分析聚焦于已采集的图像,而对图像形成管线和环境影响的研究相对不足。本文通过分析捕获条件(如相机参数和照明)对 DL 模型在三个视觉任务(图像分类、目标检测和视觉问答(VQA))上的影响来弥合这一差距。为此,我们评估了常见视觉数据集中的捕获偏差,并构建了一个新基准 SNAP(取自 S\textbf{S}hutter speed, ISO seN\textbf{N}sitivity, and AP\textbf{AP}erture),包含在受控照明条件下、相机设置密集采样的图像。我们随后评估了众多 DL 视觉模型,展示了捕获条件对每个选定视觉任务的影响。最后,我们进行实验建立 VQA 任务的人类基准。结果表明,计算机视觉数据集存在显著偏差,训练此类数据的模型即使在曝光良好的图像上也无法达到人类水平,且对重大曝光变化和相机设置细微变动都高度敏感。代码与数据可在 https://github.com/ykotseruba/SNAP 访问。

关键词

引用

@article{arxiv.2505.15628,
  title  = {SNAP: A Benchmark for Testing the Effects of Capture Conditions on Fundamental Vision Tasks},
  author = {Iuliia Kotseruba and John K. Tsotsos},
  journal= {arXiv preprint arXiv:2505.15628},
  year   = {2025}
}