中文

用于多模态黑色素瘤诊断的检索增强视觉语言模型

计算机视觉与模式识别 2025-09-11 v1 人工智能 机器学习

摘要

准确且及早诊断恶性黑色素瘤对于改善患者预后至关重要。虽然卷积神经网络 (CNN) 在皮肤图像分析方面显示出前景,但往往忽略临床元数据且需要大量预处理。视觉语言模型 (VLM) 提供了一种多模态替代方案,但在在一般领域数据上训练时难以捕获临床特异性。为此,我们提出了一种检索增强 VLM 框架,将语义相似的患者病例纳入诊断提示中。该方法无需微调即可实现明确的预测,显著提高了分类准确率和错误更正率,超出传统基线方法。这些结果表明,检索增强的提示提供了一种可靠的临床决策支持策略。

关键词

引用

@article{arxiv.2509.08338,
  title  = {Retrieval-Augmented VLMs for Multimodal Melanoma Diagnosis},
  author = {Jihyun Moon and Charmgil Hong},
  journal= {arXiv preprint arXiv:2509.08338},
  year   = {2025}
}

备注

Medical Image Computing and Computer-Assisted Intervention (MICCAI) ISIC Skin Image Analysis Workshop (MICCAI ISIC) 2025; 10 pages