CoMA:统一预训练框架中的互补掩码与层次化动态多窗口自注意力
计算机视觉与模式识别
2025-11-11 v1 人工智能
摘要
掩码自编码器(MAE)通过随机删除视觉标记的部分并重建原始图像的预文本任务,显著提升了图像表示的自监督学习效率,并在下游任务中展现出卓越的适应性。然而,MAE 及其他采用随机掩码的 MAE 风格范式需要更多的预训练 epoch 才能维持适应性。同时,MAE 中的 ViT 因各层固定空间分辨率而存在参数使用效率低下的问题。为克服这些限制,我们提出互补掩码自编码器(CoMA),采用互补掩码策略确保所有像素的均匀采样,从而改进所有特征的有效学习,增强模型的适应性。进一步,我们引入 DyViT,一种层次化视觉变换器,采用动态多窗口自注意力(DM-MSA),显著降低参数和 FLOPs,同时改进细粒度特征学习。在 ImageNet-1K 上使用 CoMA 预训练的 DyViT 仅需 MAE 的 12% 预训练 epoch 即可匹配其下游性能,显示更有效的学习。它还实现了每个预训练 epoch 10% 的时间减少,进一步彰显了其在预训练效率方面的优势。
引用
@article{arxiv.2511.05929,
title = {CoMA: Complementary Masking and Hierarchical Dynamic Multi-Window Self-Attention in a Unified Pre-training Framework},
author = {Jiaxuan Li and Qing Xu and Xiangjian He and Ziyu Liu and Chang Xing and Zhen Chen and Daokun Zhang and Rong Qu and Chang Wen Chen},
journal= {arXiv preprint arXiv:2511.05929},
year = {2025}
}
备注
9 pages, 5 figures