通过块嵌入中的 PreLayerNorm 提升视觉 Transformer 的鲁棒性
计算机视觉与模式识别
2021-11-17 v1
摘要
视觉 Transformer(ViT)近来在各种视觉任务中展现出最先进的性能,取代了卷积神经网络(CNN)。同时,由于 ViT 具有与 CNN 不同的架构,其表现可能有所不同。为研究 ViT 的可靠性,本文考察了 ViT 的行为与鲁棒性。我们通过假设在实际视觉任务中可能出现的各种图像损坏,比较了 CNN 与 ViT 的鲁棒性。我们确认,对于大多数图像变换,ViT 表现出与 CNN 相当或更佳的鲁棒性。然而,对于对比度增强,ViT 中持续观察到严重的性能下降。通过详细分析,我们确定了一个潜在问题:当颜色尺度改变时,ViT 块嵌入中的位置嵌入可能工作不正常。在此我们主张使用 PreLayerNorm,一种改进的块嵌入结构,以确保 ViT 的尺度不变行为。带有 PreLayerNorm 的 ViT 在各种损坏(包括对比度变化环境)中表现出改进的鲁棒性。
引用
@article{arxiv.2111.08413,
title = {Improved Robustness of Vision Transformer via PreLayerNorm in Patch Embedding},
author = {Bum Jun Kim and Hyeyeon Choi and Hyeonah Jang and Dong Gu Lee and Wonseok Jeong and Sang Woo Kim},
journal= {arXiv preprint arXiv:2111.08413},
year = {2021}
}
备注
7 pages, 8 figures. Work in Progress