RobustFormer:面向图像与视频的噪声鲁棒预训练
计算机视觉与模式识别
2026-01-12 v2
摘要
尽管基于深度学习的模型(如Transformer)已经彻底改变了时间序列和视觉任务,但它们仍然极易受到噪声的影响,并且往往过度拟合噪声模式而非鲁棒特征。这一问题在视觉Transformer中尤为严重,因为它们依赖于容易被破坏的像素级细节。为了解决这个问题,我们利用离散小波变换(DWT)将其分解为多分辨率层的能力,将噪声主要隔离在高频域,同时保留必要的低频信息以实现弹性特征学习。然而,传统的基于DWT的方法由于需要后续的逆离散小波变换(IDWT)步骤而面临计算效率低下的问题。在这项工作中,我们引入了RobustFormer,一种新颖的框架,它通过使用DWT进行高效下采样,实现了图像和视频的噪声鲁棒掩码自编码器(MAE)预训练,消除了昂贵的IDWT重建需求,并简化了注意力机制以专注于噪声鲁棒的多尺度表示。据我们所知,RobustFormer是第一个完全兼容视频输入和MAE风格预训练的基于DWT的方法。在噪声图像和视频数据集上的大量实验表明,与基线相比,我们的方法在Imagenet-C的严重噪声条件下Top-1分类准确率提高了高达8%,在Imagenet-P标准基准上提高了高达2.7%,在UCF-101上在严重自定义噪声扰动下Top-1准确率提高了高达13%,同时在干净数据集上保持了相似的准确率分数。我们还观察到,与VideoMAE基线相比,通过去除IDWT,计算复杂度降低了高达4.4%,且没有任何性能下降。
引用
@article{arxiv.2411.13040,
title = {RobustFormer: Noise-Robust Pre-training for images and videos},
author = {Ashish Bastola and Nishant Luitel and Hao Wang and Danda Pani Paudel and Roshani Poudel and Abolfazl Razi},
journal= {arXiv preprint arXiv:2411.13040},
year = {2026}
}
备注
13 pages