LipShiFT:一种可认证鲁棒的基于移位的视觉Transformer
机器学习
2025-03-20 v1 人工智能
计算机视觉与模式识别
摘要
为基于Transformer的架构推导紧致的Lipschitz界是一项重大挑战。大输入尺寸和高维注意力模块通常在训练过程中构成关键瓶颈,导致次优结果。我们的研究揭示了这些方法在视觉任务中的实际约束。我们发现基于Lipschitz边界的间隔训练作为一种强正则化器,同时限制模型连续层中的权重。我们聚焦于ShiftViT模型的Lipschitz连续变体,在范数约束输入设置下解决了基于Transformer架构的显著训练挑战。我们使用 范数在常见图像分类数据集上为该模型提供了Lipschitz常数的上界估计。最终,我们证明我们的方法可扩展至更大模型,并在基于Transformer架构的认证鲁棒性方面推进了最先进水平。
引用
@article{arxiv.2503.14751,
title = {LipShiFT: A Certifiably Robust Shift-based Vision Transformer},
author = {Rohan Menon and Nicola Franco and Stephan Günnemann},
journal= {arXiv preprint arXiv:2503.14751},
year = {2025}
}
备注
ICLR 2025 Workshop: VerifAI: AI Verification in the Wild