掩码胶囊自编码器
计算机视觉与模式识别
2025-04-21 v2
摘要
我们提出了掩码胶囊自编码器,这是首个在现代自监督范式(具体即掩码图像建模框架)中利用预训练的胶囊网络。胶囊网络已成为卷积神经网络的强大替代方案。与 Vision Transformer 相比,它们展现出有利的特性,但在面对更复杂的数据时一直难以有效学习。这导致胶囊网络模型无法扩展到现代任务。我们提出的 MCAE 模型通过重新构建胶囊网络,将掩码图像建模作为监督微调之前的预训练阶段,从而缓解了这一问题。通过多项实验和消融研究,我们证明,与 CNN 和 ViT 类似,胶囊网络同样能从自监督预训练中受益,为该神经网络领域的进一步发展铺平了道路。例如,通过在 Imagenette 数据集(包含 10 个 ImageNet 尺寸图像类别)上进行预训练,我们取得了胶囊网络的最先进结果,与基线模型相比提升了 9%。因此,我们提出胶囊网络受益于且应在掩码图像建模框架内进行训练,并使用新颖的胶囊解码器,以增强胶囊网络在真实尺寸图像上的性能。
引用
@article{arxiv.2403.04724,
title = {Masked Capsule Autoencoders},
author = {Miles Everett and Mingjun Zhong and Georgios Leontidis},
journal= {arXiv preprint arXiv:2403.04724},
year = {2025}
}
备注
15 pages, 7 figures, 5 tables - accepted at TMLR