中文

MAKE:用于零样本皮肤病学评估的多方面知识增强视觉语言预训练

计算机视觉与模式识别 2025-05-15 v1

摘要

皮肤病学诊断代表了一个复杂的多模态挑战,需要将视觉特征与专业的临床知识相整合。虽然视觉语言预训练 (VLP) 推进了医疗 AI,但其在皮肤病学中的有效性受限于文本长度约束和结构化文本的缺乏。在本文中,我们引入了 MAKE,一个用于零样本皮肤病学任务的多方面知识增强视觉语言预训练框架。认识到全面的皮肤病学描述需要超出标准文本约束的多个知识方面,我们的框架引入了:(1) 一种多方面对比学习策略,通过大语言模型将临床叙述分解为知识增强的子文本;(2) 一种细粒度对齐机制,将子标题与诊断相关的图像特征连接起来;(3) 一种诊断引导的加权方案,根据临床显著性先验自适应地优先处理不同的子标题。通过在从教育资源收集的 403,563 个皮肤病学图文对上进行预训练,MAKE 在零样本皮肤病分类、概念标注和跨模态检索任务的八个数据集上显著优于最先进的 VLP 模型。我们的代码将在 https://github.com/SiyuanYan1/MAKE 公开发布。

关键词

引用

@article{arxiv.2505.09372,
  title  = {MAKE: Multi-Aspect Knowledge-Enhanced Vision-Language Pretraining for Zero-shot Dermatological Assessment},
  author = {Siyuan Yan and Xieji Li and Ming Hu and Yiwen Jiang and Zhen Yu and Zongyuan Ge},
  journal= {arXiv preprint arXiv:2505.09372},
  year   = {2025}
}

备注

MICCAI2025 early acceptance; First two authors contribute equally