CTA-Net:用于改进多尺度特征提取的 CNN-Transformer 聚合网络
计算机视觉与模式识别
2024-10-16 v1 人工智能
摘要
卷积神经网络 (CNN) 和视觉Transformer (ViT) 已成为计算机视觉中进行局部和全局特征提取的关键技术。然而,现有方法常将这些架构进行聚合,存在效率问题。为此,开发了 CNN-Transformer 聚合网络 (CTA-Net)。CTA-Net 将CNN与ViT结合,Transformer负责捕获长程依赖,CNN则提取局部特征。这种集成使能够高效处理详细的局部特征及更广阔的上下文信息。CTA-Net引入了轻量级多尺度特征融合多头自注意力模块 (LMF-MHSA),实现高效的多尺度特征集成且参数更少。此外,逆向重构CNN变体模块 (RRCV) 增强了CNN在Transformer架构中的嵌入。在样本数不足10万的小规模数据集上进行的广泛实验表明,CTA-Net取得卓越性能(TOP-1准确率86.76%),参数更少(20.32M),且更高效(FLOPs 2.83B),为视觉任务在小规模数据集(不足10万样本)上提供了高效轻量化的解决方案。
引用
@article{arxiv.2410.11428,
title = {CTA-Net: A CNN-Transformer Aggregation Network for Improving Multi-Scale Feature Extraction},
author = {Chunlei Meng and Jiacheng Yang and Wei Lin and Bowen Liu and Hongda Zhang and chun ouyang and Zhongxue Gan},
journal= {arXiv preprint arXiv:2410.11428},
year = {2024}
}
备注
9 pages, 3 figures