基于 Transformer 的可解释多模态数据融合用于皮肤病变分类
图像与视频处理
2023-09-01 v2 计算机视觉与模式识别
机器学习
摘要
当前许多深度学习(DL)研究主要聚焦于改进量化指标而忽视其他因素。在以人为中心的应用中,如皮肤科的皮肤病变分类,由于决策过程透明度有限,DL 驱动的临床决策支持系统仍处于起步阶段。此外,缺乏能够解释训练后 DL 算法行为的流程,导致临床医生几乎不信任。为诊断皮肤病变,皮肤科医生依赖疾病的视觉评估与从患者既往史收集的数据。处理多模态数据的的数据驱动算法受限于卷积架构所需的特徵级与决策级融合流程的分离。为解决此问题,我们通过基于 transformer 架构的注意力机制实现单阶段多模态数据融合,以辅助皮肤疾病诊断。我们的方法在图像丰富和患者数据丰富的环境中均击败其他最先进的单模态与多模态 DL 架构。此外,该架构的选择原生支持分类任务在图像与元数据域的可解释性,无需额外修改。
引用
@article{arxiv.2304.14505,
title = {Transformer-based interpretable multi-modal data fusion for skin lesion classification},
author = {Theodor Cheslerean-Boghiu and Melia-Evelina Fleischmann and Theresa Willem and Tobias Lasser},
journal= {arXiv preprint arXiv:2304.14505},
year = {2023}
}
备注
Submitted to IEEE JBHI in July 2023