迷失在翻译中:现代神经网络仍难以应对微小的真实图像变换
计算机视觉与模式识别
2024-04-11 v1
摘要
在图像分类中表现卓越的深度神经网络先前已被证明容易被微小变换(如输入图像的一个像素平移)所欺骗。为了解决这个问题,近年来提出了两种方法。第一种方法建议使用大型数据集结合数据增强,希望高度多样化的训练集能教会网络学习不变性。第二种方法建议使用基于采样理论的架构修改来明确处理图像平移。在本文中,我们表明这些方法在处理模拟相机方向细微变化的"自然"图像平移时仍然不足。我们的发现揭示,在最新模型(例如在LAION-2B上训练的open-CLIP或DINO-v2)中,仅一个像素的平移就可能导致约40%的测试图像的预测图像表示发生显著变化,而明确构建为对循环平移鲁棒的模型仍然有11%的时间可以被1像素的真实(非循环)平移欺骗。我们提出了基于裁剪选择的鲁棒推理:一种简单的方法,可以证明能达到任何期望的一致性水平,尽管会以模型精度为适度代价。重要的是,我们展示了使用该方法如何将用1像素平移欺骗最新模型的能力降低到5%以下,同时分类精度仅下降1%。此外,我们展示了我们的方法可以轻松调整以处理循环移位。在这种情况下,我们以最先进的精度实现了对整数移位的100%鲁棒性,且无需任何进一步训练。
引用
@article{arxiv.2404.07153,
title = {Lost in Translation: Modern Neural Networks Still Struggle With Small Realistic Image Transformations},
author = {Ofir Shifman and Yair Weiss},
journal= {arXiv preprint arXiv:2404.07153},
year = {2024}
}
备注
14 pages, 6 appendices, 17 figures