深度 CNN 架构进展的综合综述:挑战、应用与新兴研究方向
计算机视觉与模式识别
2025-03-24 v1 人工智能
机器学习
图像与视频处理
摘要
深度卷积神经网络(CNN)显著推动了深度学习的发展,在计算机视觉、自然语言处理、医学诊断、目标检测和语音识别等领域取得了突破。架构创新包括 1D、2D 和 3D 卷积模型、膨胀卷积和分组卷积、深度可分离卷积以及注意力机制,解决了领域特定挑战并增强了特征表示和计算效率。空间-通道利用、多路径设计和特征图增强等结构改进有助于稳健的层次化特征提取和 improved generalization,特别是通过迁移学习。高效的预处理策略,包括傅里叶变换、结构化变换、低精度计算和权重压缩,优化了推理速度并促进了资源受限环境中的部署。本综述提出了一种统一分类法,根据空间利用、多路径结构、深度、宽度、维度扩展、通道增强和注意力机制对 CNN 架构进行分类。系统综述了 CNN 在人脸识别、姿态估计、动作识别、文本分类、统计语言建模、疾病诊断、放射学分析、加密货币情感预测、1D 数据处理、视频分析和语音识别中的应用。除了整合架构进展外,综述还突出了少样本、零样本、弱监督、联邦学习等新兴学习范式,未来研究方向包括混合 CNN-Transformer 模型、视觉语言融合、生成式学习等。本综述全面审视了 CNN 从 2015 年到 2025 年的演变,概述了关键创新、挑战和机遇。
引用
@article{arxiv.2503.16546,
title = {A Comprehensive Survey on Architectural Advances in Deep CNNs: Challenges, Applications, and Emerging Research Directions},
author = {Saddam Hussain Khan and Rashid Iqbal},
journal= {arXiv preprint arXiv:2503.16546},
year = {2025}
}
备注
100 Pages, 44 Figures