用于多模态黑色素瘤诊断的检索增强视觉语言模型
计算机视觉与模式识别
2025-09-11 v1 人工智能
机器学习
摘要
准确且及早诊断恶性黑色素瘤对于改善患者预后至关重要。虽然卷积神经网络 (CNN) 在皮肤图像分析方面显示出前景,但往往忽略临床元数据且需要大量预处理。视觉语言模型 (VLM) 提供了一种多模态替代方案,但在在一般领域数据上训练时难以捕获临床特异性。为此,我们提出了一种检索增强 VLM 框架,将语义相似的患者病例纳入诊断提示中。该方法无需微调即可实现明确的预测,显著提高了分类准确率和错误更正率,超出传统基线方法。这些结果表明,检索增强的提示提供了一种可靠的临床决策支持策略。
引用
@article{arxiv.2509.08338,
title = {Retrieval-Augmented VLMs for Multimodal Melanoma Diagnosis},
author = {Jihyun Moon and Charmgil Hong},
journal= {arXiv preprint arXiv:2509.08338},
year = {2025}
}
备注
Medical Image Computing and Computer-Assisted Intervention (MICCAI) ISIC Skin Image Analysis Workshop (MICCAI ISIC) 2025; 10 pages