中文

EVCC:面向分类的增强型 Vision Transformer-ConvNeXt-CoAtNet 融合

计算机视觉与模式识别 2025-11-25 v1

摘要

混合视觉架构通过组合 Transformer 和 CNN 显著推进了图像分类,但通常以显著的计算成本为代价。我们引入 EVCC (增强型 Vision Transformer-ConvNeXt-CoAtNet),一种新型多分支架构,将 Vision Transformer、轻量级 ConvNeXt 和 CoAtNet 集成,通过关键创新实现:(1) 信息保留的自适应 token 剪枝,(2) 增强特征细化的门控双向交叉注意力,(3) 用于多任务学习的辅助分类头,以及 (4) 采用基于上下文感知置信度驱动加权的动态路由门。跨 CIFAR-100、Tobacco3482、CelebA 和 Brain Cancer 数据集的实验表明,EVCC 在 DeiT-Base、MaxViT-Base 和 CrossViT-Base 等强大模型之上持续实现最先进的准确性,提高了最高可达 2 个百分点,同时将 FLOPs 降低 25%~35%。我们的自适应架构通过动态减少 token 数量来调整计算需求,以适应部署需求,在组合全局上下文、局部细节和层次特征以实现真实世界应用的同时,高效平衡了准确性与效率之间的权衡。我们的实现源代码可在 https://anonymous.4open.science/r/EVCC 上获取。

关键词

引用

@article{arxiv.2511.18691,
  title  = {EVCC: Enhanced Vision Transformer-ConvNeXt-CoAtNet Fusion for Classification},
  author = {Kazi Reyazul Hasan and Md Nafiu Rahman and Wasif Jalal and Sadif Ahmed and Shahriar Raj and Mubasshira Musarrat and Muhammad Abdullah Adnan},
  journal= {arXiv preprint arXiv:2511.18691},
  year   = {2025}
}