探索 synergistic 集成学习:统一 CNN、MLP-Mixer 与 Vision Transformer 以提升图像分类
计算机视觉与模式识别
2025-04-15 v1
摘要
近年来,卷积神经网络(Convolutional Neural Networks, CNNs)、MLP-mixer 和 Vision Transformer 在图像分类任务中崭露头角。先前的研究强调了每种架构的独特优势,越来越多的证据表明,结合来自不同架构的模块可提升性能。本研究在改进前期探索不同架构互补性的基础上进行进一步深化。不同于通过试错对不同架构的模块进行启发式合并,我们保留各架构的完整性,并使用集成技术进行组合。通过保持各架构的独特性,我们旨在更深入地、在隐式隔离的情况下探索它们的内在互补性。这种方法提供了对各自优势的更系统性理解。除了揭示架构互补性的见解外,我们展示了即使是最基础的集成方法,也能显著优于由相似架构组成的集成。我们的简单集成框架作为一种基础策略,可用于混合互补架构,为进一步探讨不同架构及其集成在图像分类中独特优势和协同作用提供坚实起点。本工作的直接成果是创建一个超越前沿单一分类网络准确率的集成分类网络,在 ImageNet 上设定了新纪录,同时整体延迟更低。
引用
@article{arxiv.2504.09076,
title = {Exploring Synergistic Ensemble Learning: Uniting CNNs, MLP-Mixers, and Vision Transformers to Enhance Image Classification},
author = {Mk Bashar and Ocean Monjur and Samia Islam and Mohammad Galib Shams and Niamul Quader},
journal= {arXiv preprint arXiv:2504.09076},
year = {2025}
}