用于鲁棒 Vision Transformer 的近似零空间增强微调
计算机视觉与模式识别
2025-03-31 v2 机器学习
摘要
增强深度学习模型的鲁棒性,尤其是在 vision transformer (ViT) 领域,对于其在现实世界中的部署至关重要。在这项工作中,我们受线性代数中零空间概念的启发,提供了一种微调方法以增强 vision transformer 的鲁棒性。我们的研究重点是 vision transformer 是否能表现出类似于线性映射中零空间性质的对输入变化的弹性,这意味着从此零空间中采样的扰动在添加到输入时不会影响模型的输出。我们从许多现有 ViT 满足该性质的观察出发,因为它们的 patch embedding 层具有非平凡零空间。然后,我们将零空间的概念扩展到非线性设置,并证明可以通过优化为 ViT 的编码器块合成近似零空间元素。最后,我们提出了一种 ViT 的微调策略,其中我们用合成的近似零空间噪声来增强训练数据。我们发现我们的微调方法显著提升了模型对对抗性和自然图像扰动的鲁棒性。\footnote{代码获取地址:https://github.com/Liu-Hy/ns-vit。
关键词
引用
@article{arxiv.2403.10476,
title = {Approximate Nullspace Augmented Finetuning for Robust Vision Transformers},
author = {Haoyang Liu and Aditya Singh and Yijiang Li and Haohan Wang},
journal= {arXiv preprint arXiv:2403.10476},
year = {2025}
}
备注
CPAL 2025, Oral