重新思考掩码自编码器的补丁依赖
计算机视觉与模式识别
2025-04-11 v2
摘要
在这项工作中,我们研究了掩码自编码器(MAE)解码器中补丁间依赖对表示学习的影响。我们将掩码重建的解码机制分解为掩码令牌之间的自注意力和掩码与可见令牌之间的交叉注意力。我们的发现表明,MAE并非通过解码器中补丁间的交互,而是通过在编码器内学习全局表示来从可见补丁重建连贯图像。这一发现促使我们提出一个简单的视觉预训练框架:交叉注意力掩码自编码器(CrossMAE)。该框架仅在解码器中使用交叉注意力,从编码器输出中独立读出少量掩码补丁的重建结果。该方法在从ViT-S到ViT-H的模型中取得了与传统MAE相当或更优的性能,并显著降低了计算需求。通过其设计,CrossMAE挑战了掩码令牌间交互对于有效掩码预训练的必要性。代码和模型已公开:https://crossmae.github.io
引用
@article{arxiv.2401.14391,
title = {Rethinking Patch Dependence for Masked Autoencoders},
author = {Letian Fu and Long Lian and Renhao Wang and Baifeng Shi and Xudong Wang and Adam Yala and Trevor Darrell and Alexei A. Efros and Ken Goldberg},
journal= {arXiv preprint arXiv:2401.14391},
year = {2025}
}
备注
Transactions on Machine Learning Research (TMLR) 2025