中文

掩码胶囊自编码器

计算机视觉与模式识别 2025-04-21 v2

摘要

我们提出了掩码胶囊自编码器,这是首个在现代自监督范式(具体即掩码图像建模框架)中利用预训练的胶囊网络。胶囊网络已成为卷积神经网络的强大替代方案。与 Vision Transformer 相比,它们展现出有利的特性,但在面对更复杂的数据时一直难以有效学习。这导致胶囊网络模型无法扩展到现代任务。我们提出的 MCAE 模型通过重新构建胶囊网络,将掩码图像建模作为监督微调之前的预训练阶段,从而缓解了这一问题。通过多项实验和消融研究,我们证明,与 CNN 和 ViT 类似,胶囊网络同样能从自监督预训练中受益,为该神经网络领域的进一步发展铺平了道路。例如,通过在 Imagenette 数据集(包含 10 个 ImageNet 尺寸图像类别)上进行预训练,我们取得了胶囊网络的最先进结果,与基线模型相比提升了 9%。因此,我们提出胶囊网络受益于且应在掩码图像建模框架内进行训练,并使用新颖的胶囊解码器,以增强胶囊网络在真实尺寸图像上的性能。

关键词

引用

@article{arxiv.2403.04724,
  title  = {Masked Capsule Autoencoders},
  author = {Miles Everett and Mingjun Zhong and Georgios Leontidis},
  journal= {arXiv preprint arXiv:2403.04724},
  year   = {2025}
}

备注

15 pages, 7 figures, 5 tables - accepted at TMLR