VL-MedGuide:用于智能可解释皮肤病辅助诊断的视觉语言大模型
计算机视觉与模式识别
2025-08-12 v1
摘要
皮肤病的精准诊断因 dermatoscopic 图像中呈现的复杂多样的视觉特征而 remains a significant challenge,现有纯视觉诊断模型常缺乏可解释性。为此,我们引入 VL-MedGuide (Visual-Linguistic Medical Guide),一个新型框架,利用视觉语言大模型 (LVLMs) 的强大多模态理解与推理能力,用于智能且内在可解释的皮肤病辅助诊断。VL-MedGuide 在两个相互关联的阶段运行:多模态概念感知模块,通过精妙的 prompt engineering 来识别并用语言描述皮肤学相关的视觉特征;可解释疾病推理模块,通过链式思考 prompting 将这些概念与原始视觉信息集成,以提供精确的疾病诊断及透明的理由。针对 Derm7pt 数据集进行的全面实验表明,VL-MedGuide 在疾病诊断 (83.55% BACC, 80.12% F1) 和概念检测 (76.10% BACC, 67.45% F1) 方面均实现了最新的性能,超越了现有基线。此外,人类评估确认其生成解释的清晰度、完整性和可信度高,弥合了 AI 性能与临床实用性之间的鸿沟,为皮肤科实践提供可操作的、可解释的见解。
引用
@article{arxiv.2508.06624,
title = {VL-MedGuide: A Visual-Linguistic Large Model for Intelligent and Explainable Skin Disease Auxiliary Diagnosis},
author = {Kexin Yu and Zihan Xu and Jialei Xie and Carter Adams},
journal= {arXiv preprint arXiv:2508.06624},
year = {2025}
}