中文

AFFMAE:面向桌面显卡的可扩展高效视觉预训练

计算机视觉与模式识别 2026-02-19 v1

摘要

自监督预训练已通过实现数据高效微调而变革计算机视觉,但高分辨率训练通常需要服务器级基础设施,限制了许多研究实验室在领域内基础模型开发的可能性。掩码自编码器 (MAE) 通过仅编码可见token来降低计算成本,但将MAE与层次化下采样架构结合仍然在结构上具有挑战性,由于稠密网格先验和mask-aware设计的权衡。我们引入AFFMAE,一种基于自适应、非网格token合并的masking友好型层次化预训练框架。通过丢弃被掩码的token并仅对可见token执行动态合并,AFFMAE消除了稠密网格假设,同时保持层次化可扩展性。我们开发了数值稳定的混合精度Flash 风格聚类注意力内核,并通过深度监督来缓解稀疏阶段表示塌陷。在高分辨率电子显微镜分割任务上,AFFMAE在相同参数数量下匹配ViT-MAE性能,FLOPs降低最高可达7倍,内存使用减半,并在单个RTX 5090上实现更快的训练。代码:https://github.com/najafian-lab/affmae。

关键词

引用

@article{arxiv.2602.16249,
  title  = {AFFMAE: Scalable and Efficient Vision Pretraining for Desktop Graphics Cards},
  author = {David Smerkous and Zian Wang and Behzad Najafian},
  journal= {arXiv preprint arXiv:2602.16249},
  year   = {2026}
}

备注

Preprint