Derm1M: 一个与临床本体知识对齐的百万规模皮肤病视觉语言数据集
计算机视觉与模式识别
2025-04-15 v2
摘要
视觉语言模型的出现为医学 AI 带来了前所未有的诊断能力和临床应用进展。然而, 由于缺乏标准的图像-文本对, 皮肤科的进展仍滞后于其他医学领域。现有的皮肤病数据集在规模和深度方面都有限, 仅提供单标签注释, 覆盖的疾病范围有限, 且缺乏实用应用所需的关键临床背景信息。为此, 本文提出 Derm1M, 第一个大规模皮肤病视觉语言数据集, 包含 1,029,761 组图像-文本对。该数据集构建于多样化教育资源之上, 围绕由专家共同开发的标准本体结构, 提供超过 390 种皮肤病的全面覆盖, 以及 130 个临床概念, 包含医史、症状和肤色等丰富的上下文信息。为展示 Derm1M 在推动 AI 研究和临床应用方面的潜力, 我们在该数据集上预训练了一系列类似 CLIP 的模型, 统称为 DermLIP。DermLIP 系列在八个多样化数据集上的多个任务中均显著优于最先进的基础模型, 包括零样皮肤病分类、临床和伪影概念识别、少样本/全样本学习以及跨模态检索。我们的数据集和代码将在接受录取后公开于 https://github.com/SiyuanYan1/Derm1M。
引用
@article{arxiv.2503.14911,
title = {Derm1M: A Million-scale Vision-Language Dataset Aligned with Clinical Ontology Knowledge for Dermatology},
author = {Siyuan Yan and Ming Hu and Yiwen Jiang and Xieji Li and Hao Fei and Philipp Tschandl and Harald Kittler and Zongyuan Ge},
journal= {arXiv preprint arXiv:2503.14911},
year = {2025}
}
备注
Our dataset and code will be publicly available at https://github.com/SiyuanYan1/Derm1M