中文

用于多视图多任务乳腺 X 光分析的 CNN-VSSM 混合模型:基于注意力融合的鲁棒诊断

图像与视频处理 2025-07-24 v1 计算机视觉与模式识别 机器学习

摘要

早期且准确地解读筛查性乳腺 X 光片对于有效的乳腺癌检测至关重要,然而由于影像表现细微及诊断模糊,这仍是一项复杂的挑战。许多现有的 AI 方法因侧重于单视图输入或单任务输出而存在不足,限制了其临床实用性。为解决这些局限性,我们提出了一种新颖的多视图多任务混合深度学习框架,该框架处理所有四个标准乳腺 X 光视图,并为每个乳房联合预测诊断标签和 BI-RADS 评分。我们的架构集成了一个混合 CNN-VSSM 主干网络,将用于丰富局部特征提取的卷积编码器与用于捕获全局上下文依赖的视觉状态空间模型(Visual State Space Models, VSSMs)相结合。为提高鲁棒性和可解释性,我们引入了一个基于门控注意力的融合模块,该模块动态地加权跨视图信息,有效处理缺失数据的情形。我们在不同复杂度的诊断任务上进行了广泛实验,在单任务和多任务学习设置下,将我们提出的混合模型与基线 CNN 架构和 VSSM 模型进行了基准比较。在所有任务中,混合模型均持续优于基线模型。在二分类 BI-RADS 1 对 5 分类任务中,共享混合模型达到了 0.9967 的 AUC 和 0.9830 的 F1 分数。在更具挑战性的三分类任务中,其 F1 分数达到 0.7790,而在五分类 BI-RADS 任务中,最佳 F1 分数达到 0.4904。这些结果突出了所提出的混合框架的有效性,并强调了多任务学习在提升诊断性能和实现具有临床意义的乳腺 X 光分析方面的潜力与局限性。

关键词

引用

@article{arxiv.2507.16955,
  title  = {A Hybrid CNN-VSSM model for Multi-View, Multi-Task Mammography Analysis: Robust Diagnosis with Attention-Based Fusion},
  author = {Yalda Zafari and Roaa Elalfy and Mohamed Mabrok and Somaya Al-Maadeed and Tamer Khattab and Essam A. Rashed},
  journal= {arXiv preprint arXiv:2507.16955},
  year   = {2025}
}