中文

使用反事实仿真测试探究 Transformer 与 ConvNet 的差异

计算机视觉与模式识别 2022-11-30 v1 人工智能 机器学习

摘要

现代深度神经网络往往在静态测试集上进行评估。这样做的一个缺点是,这些深度神经网络无法轻易针对特定场景变化的鲁棒性问题进行评估。例如,很难研究这些网络对物体尺度、物体姿态、场景光照和 3D 遮挡变化的鲁棒性。主要原因是收集具有足够规模的细粒度自然主义变化的真实数据集可能极其耗时且昂贵。在这项工作中,我们提出了反事实仿真测试,这是一个反事实框架,允许我们通过构建逼真的合成场景来研究神经网络对其中一些自然主义变化的鲁棒性,这些场景允许我们向模型提出反事实问题,最终为诸如“如果从顶部观察物体,您的分类仍然正确吗?”或“如果物体被另一物体部分遮挡,您的分类仍然正确吗?”等问题提供答案。我们的方法允许针对这些自然主义变化,公平比较最近发布的、最先进的卷积神经网络和视觉 Transformer 的鲁棒性。我们发现证据表明,ConvNext 对姿态和尺度变化的鲁棒性优于 Swin,ConvNext 对我们的仿真域泛化能力更好,而 Swin 处理部分遮挡的能力优于 ConvNext。我们还发现,所有网络的鲁棒性都随网络规模以及数据规模和多样性的增加而提高。我们发布了自然变化物体数据集(NVD),这是一个包含 27.2 万张日常物体图像的大型合成数据集,具有物体姿态、尺度、视角、光照和遮挡等自然变化。项目页面:https://counterfactualsimulation.github.io

关键词

引用

@article{arxiv.2211.16499,
  title  = {Finding Differences Between Transformers and ConvNets Using Counterfactual Simulation Testing},
  author = {Nataniel Ruiz and Sarah Adel Bargal and Cihang Xie and Kate Saenko and Stan Sclaroff},
  journal= {arXiv preprint arXiv:2211.16499},
  year   = {2022}
}

备注

Published at the Conference on Neural Information Processing Systems (NeurIPS) 2022