您的注意力 matters:提高模型对噪声和虚假关联的鲁棒性
机器学习
2025-09-09 v3
摘要
自注意力机制是 Transformer 架构的基础,支撑着其在广泛任务中的惊人成功。尽管存在多种自注意力变体,但其对噪声和虚假关联的鲁棒性尚未得到充分研究。本研究评估了 Softmax、Sigmoid、Linear、Doubly Stochastic 和 Cosine 注意力机制在视觉 Transformer 中的表现,针对不同的数据腐化情景进行测试。通过在 CIFAR-10、CIFAR-100 和 Imagenette 数据集上进行测试,我们发现 Doubly Stochastic 注意力最为鲁棒。在训练数据或训练和测试数据均被腐化时,它 consistently 优于下一名机制高出 。我们的发现为在数据不完美的情境下选择自注意力机制提供了指导。相关代码已发布于 https://github.com/ctamayor/NeurIPS-Robustness-ViT。
关键词
引用
@article{arxiv.2507.20453,
title = {Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations},
author = {Camilo Tamayo-Rousseau and Yunjia Zhao and Yiqun Zhang and Randall Balestriero},
journal= {arXiv preprint arXiv:2507.20453},
year = {2025}
}