MM-Skin:利用源自教科书的图像-文本数据集增强皮肤病学视觉-语言模型
计算机视觉与模式识别
2025-05-12 v1 人工智能
摘要
医学视觉-语言模型 (VLM) 已显示出作为跨多个医学领域的临床助手的潜力。然而,能够提供专业且详细诊断分析的专用皮肤病学 VLM 仍发展不足,这主要是由于当前皮肤病学多模态数据集中缺乏专业化的文本描述。为了解决这个问题,我们提出了 MM-Skin,这是首个大规模多模态皮肤病学数据集,它包含 3 种成像模态,包括临床、皮肤镜和病理图像,以及从专业教科书中收集的近 10k 高质量图像-文本对。此外,我们生成了超过 27k 个多样化的、遵循指令的视觉问答 (VQA) 样本(是当前最大皮肤病学 VQA 数据集的 9 倍)。利用公共数据集和 MM-Skin,我们开发了 SkinVL,这是一个专为精确和细致入微的皮肤病解读而设计的皮肤病学专用 VLM。在 8 个数据集上对 SkinVL 进行的 VQA、监督微调 (SFT) 和零样本分类任务的综合基准评估,揭示了其在皮肤病诊断方面相较于通用和医学 VLM 模型的卓越性能。MM-Skin 和 SkinVL 的引入为推动临床皮肤病学 VLM 助手的发展做出了有意义的贡献。MM-Skin 可在 https://github.com/ZwQ803/MM-Skin 获取。
引用
@article{arxiv.2505.06152,
title = {MM-Skin: Enhancing Dermatology Vision-Language Model with an Image-Text Dataset Derived from Textbooks},
author = {Wenqi Zeng and Yuqi Sun and Chenxi Ma and Weimin Tan and Bo Yan},
journal= {arXiv preprint arXiv:2505.06152},
year = {2025}
}