中文

S$^3$F-Net:通过空间-频谱摘要融合网络进行医学图像分类的多模态方法

图像与视频处理 2025-09-30 v1 人工智能 计算机视觉与模式识别 机器学习 信号处理

摘要

卷积神经网络(CNN)因其学习层次化空间特征的卓越能力已成为医学图像分析的基石。然而,这种对单一领域的关注在捕获全局整体模式方面效率低下,且未能显式建模图像的频域特征。为了应对这些挑战,我们提出了空间-频谱摘要融合网络(S3^3F-Net),一个同时从空间和频谱表示学习的双分支框架。S3^3F-Net将深层空间CNN与我们提出的浅层频谱编码器SpectraNet进行融合。SpectraNet包含所提出的频谱滤波器层,该层利用卷积定理,通过计算高效逐元素乘法将一组可学习滤波器直接应用于图像的全傅里叶频谱。这使得频谱滤波器层能够瞬间获得全局感受野,其输出由轻量级摘要网络进行蒸馏。我们在四个涵盖不同模态的医学成像数据集上评估了S3^3F-Net,以验证其有效性和通用性。我们的框架在所有情况下均一致且显著地优于其强大的空间-only基线,准确率提升高达5.13%。通过强大的双线性融合,S3^3F-Net在BRISC2025数据集上取得了98.76%的SOTA竞争准确率。拼接融合在以纹理为主的胸部X光肺炎数据集上表现更好,取得了93.11%的准确率,超越了许多性能优异但更深层的模型。我们的可解释性分析还揭示S3^3F-Net能够根据输入病理动态调整对各分支的依赖程度。这些结果验证了我们的双域方法是医学图像分析中强大且通用的范式。

关键词

引用

@article{arxiv.2509.23442,
  title  = {S$^3$F-Net: A Multi-Modal Approach to Medical Image Classification via Spatial-Spectral Summarizer Fusion Network},
  author = {Md. Saiful Bari Siddiqui and Mohammed Imamul Hassan Bhuiyan},
  journal= {arXiv preprint arXiv:2509.23442},
  year   = {2025}
}

备注

Submitted to IEEE Journal of Biomedical and Health Informatics (JBHI). This preprint includes few additional details not present in the journal submission