中文

RS-CA-HSICT:基于残差和空间通道增强的 CNN-Transformer 框架用于猴猴疱疹检测

计算机视觉与模式识别 2025-11-20 v1 人工智能 机器学习

摘要

本工作提出一种混合深度学习方法,即基于残差和空间学习的通道增强集成 CNN-Transformer 架构,利用 CNN 和 Transformer 的优势,以实现更好的 MPox 检测。 proposed RS-CA-HSICT 框架由 HSICT 模块、残差 CNN 模块、空间 CNN 块和 CA 组成,这些组件增强了多样化的特征空间、细微的皮疹信息以及长程依赖关系。新的 HSICT 模块首先整合了干Stem CNN 的抽象表示和定制的 ICT 块,以实现高效的多头注意力和结构化 CNN 层,包含均质 (H) 和结构 (S) 操作。定制的 ICT 块学习全局语境相互作用和局部纹理提取。此外,H 和 S 层通过降低噪声和建模复杂形态变化来学习空间均匀性和细节结构。逆残差学习增强了梯度消失,阶段性分辨率降低确保尺度不变性。此外,RS-CA-HSICT 框架通过 TL 驱动的残差和空间 CNN 图对所学习的 HSICT 通道进行增强,以捕获全局和局部结构线索、细微纹理和对比度变化。这些通道在增强之前通过 Channel-Fusion-and-Attention 模块被精炼,该模块在保持判别性通道的同时抑制冗余通道,从而实现高效计算。最后,空间注意力机制细化像素选择,以检测细微模式和类内对比度变化。在 Kaggle 基准和多样化 MPox 数据集上的实验结果显示,分类准确率最高可达 98.30%,F1 分数达 98.13%,优于现有的 CNN 和 ViT。

关键词

引用

@article{arxiv.2511.15476,
  title  = {RS-CA-HSICT: A Residual and Spatial Channel Augmented CNN Transformer Framework for Monkeypox Detection},
  author = {Rashid Iqbal and Saddam Hussain Khan},
  journal= {arXiv preprint arXiv:2511.15476},
  year   = {2025}
}

备注

33 Pages, 12 Figure, 4 Tables