中文

融合视觉与位置信息的 Transformer:医学伤口分析的多模态深度学习框架

计算机视觉与模式识别 2025-04-15 v1

摘要

对急性和难以愈合伤口的有效识别是伤口诊断的必要步骤。高效的分类模型有助于医师以较少的经济和时间成本对伤口类型进行分类,也有助于决定最佳治疗方法。传统机器学习模型在特征选择方面存在问题,且通常笨重,难以实现准确识别。最近的深度学习 (DL) 在伤口诊断中显示出巨大的潜力。尽管 DL 似乎对伤口类型识别前景光明,但仍有大量潜力可以提高模型的效率和准确率。本研究开发了一种基于深度学习的多模态分类器,利用伤口图像及其对应的位置信息对其进行多类别分类,包括糖尿病性伤口、压疮、手术伤口和静脉性溃疡。还创建了身体地图,以提供位置数据,帮助医师更有效地标记伤口位置。该模型使用 Vision Transformer 从输入图像中提取层次特征,采用离散小波变换 (DWT) 层捕获低频和高频成分,并使用 Transformer 提取空间特征。通过三种群体优化技术(Monster Gorilla Toner (MGTO)、Improved Gray Wolf Optimization (IGWO) 和 Fox Optimization Algorithm)对神经元数量和权重向量进行优化。评估结果表明,使用优化算法进行权重向量优化可提高诊断准确率,使其成为伤口检测的非常有效的方法。在使用原始身体地图进行分类时,本模型在图像数据上的准确率为 0.8123,在图像数据和伤口位置组合数据上的准确率为 0.8007。另外,结合优化模型的准确率在 0.7801 到 0.8342 之间。

关键词

引用

@article{arxiv.2504.10452,
  title  = {Integrating Vision and Location with Transformers: A Multimodal Deep Learning Framework for Medical Wound Analysis},
  author = {Ramin Mousa and Hadis Taherinia and Khabiba Abdiyeva and Amir Ali Bengari and Mohammadmahdi Vahediahmar},
  journal= {arXiv preprint arXiv:2504.10452},
  year   = {2025}
}