TransUNet-GradCAM:用于足部溃疡分割的混合 Transformer-U-Net 及其自注意力与可解释可视化
图像与视频处理
2026-03-10 v5 计算机视觉与模式识别
摘要
糖尿病足部溃疡(DFU)的自动化分割在临床诊断、治疗规划及随访监测中发挥着关键作用。然而,由于临床照片中溃疡区域呈现出异质性外观、不规则形态以及复杂背景,此任务仍面临挑战。传统卷积神经网络(CNN),如 U-Net,虽具备强大的定位能力,但因受限于感受野,难以建模长程空间依赖关系。为此,我们采用 TransUNet 架构,这是一种集成 Vision Transformer(ViT)全局注意力机制的混合框架。该组合使模型能够提取全局上下文特征,同时保持细粒度的空间分辨率。我们在公开的足部溃疡分割挑战(FUSeg)数据集上训练模型,采用稳健的数据增强流程和混合损失函数以缓解类别不平衡问题。在内部验证集上,模型以优化阈值 0.4843 的 Dice 系数(F1 分数)达到 0.8886。更重要的是,为评估模型的泛化能力,我们在两个独立数据集上进行外部验证:AZH Wound Care Center 数据集(n=278)和 Medetec 数据集(n=152)。在未重新训练的情况下,模型分别获得 Dice 分数为 0.6209 和 0.7850,显示出对未见临床领域的稳健零样本迁移能力。此外,临床实用性分析显示,预测值与真实标记溃疡面积之间呈强相关性(Pearson r = 0.9749)。这些结果表明,我们的方法有效地集成了全局与局部特征提取,为自动足部溃疡评估提供了一个可靠、有效且可解释的解决方案。
引用
@article{arxiv.2508.03758,
title = {TransUNet-GradCAM: A Hybrid Transformer-U-Net with Self-Attention and Explainable Visualizations for Foot Ulcer Segmentation},
author = {Akwasi Asare and Mary Sagoe and Justice Williams Asare and Stephen Edward Moore},
journal= {arXiv preprint arXiv:2508.03758},
year = {2026}
}