中文

VisTA:利用多模态数据进行对比学习的视觉-文本对齐模型,用于证据驱动、可靠且可解释的阿尔茨海默病诊断

计算机视觉与模式识别 2025-02-04 v1 计算与语言 定量方法

摘要

目的:利用高维放射影像评估阿尔茨海默病(AD)在临床上很重要但具有挑战性。尽管人工智能(AI)推动了AD诊断的发展,但如何设计兼具预测性和可解释性的AI模型仍不清楚。在此,我们提出VisTA,一种由对比学习辅助的多模态语言-视觉模型,以优化疾病预测并为临床决策提供基于证据的、可解释的说明。方法:我们开发了用于AD诊断的VisTA(视觉-文本对齐模型)。在架构上,我们从BiomedCLIP构建了VisTA,并使用对比学习对其进行微调,以将图像与经过验证的异常及其描述对齐。为了训练VisTA,我们使用了一个构建的参考数据集,其中包含经医学专家验证的图像、异常类型和描述。VisTA产生四种输出:预测的异常类型、与参考病例的相似性、证据驱动的解释以及最终的AD诊断。为了说明VisTA的有效性,我们报告了异常检索和痴呆预测的准确性指标。为了证明VisTA的可解释性,我们将其解释与人类专家的解释进行了比较。结果:与用于基线预训练的1500万张图像相比,VisTA仅使用了170个样本进行微调,并在异常检索和痴呆预测方面取得了显著改进。对于异常检索,VisTA达到了74%的准确率和0.87的AUC(基线模型分别为26%和0.74)。对于痴呆预测,VisTA达到了88%的准确率和0.82的AUC(基线模型分别为30%和0.57)。生成的解释与人类专家的解释高度一致,并为诊断过程提供了见解。综上所述,VisTA优化了预测、临床推理和解释。

关键词

引用

@article{arxiv.2502.01535,
  title  = {VisTA: Vision-Text Alignment Model with Contrastive Learning using Multimodal Data for Evidence-Driven, Reliable, and Explainable Alzheimer's Disease Diagnosis},
  author = {Duy-Cat Can and Linh D. Dang and Quang-Huy Tang and Dang Minh Ly and Huong Ha and Guillaume Blanc and Oliver Y. Chén and Binh T. Nguyen},
  journal= {arXiv preprint arXiv:2502.01535},
  year   = {2025}
}