DermoGPT:面向形态导向皮肤学推理的开放权重与开放数据多模态大语言模型
计算与语言
2026-01-06 v1
摘要
多模态大语言模型 (MLLM) 在医学应用中显示出前景,但皮肤学领域的进展却滞后于人们的期望,这主要是由于训练数据有限、任务覆盖范围狭窄以及缺乏能反映专家诊断工作流程的临床依从监督信息。我们提出了一个全面的框架来解决这些问题。首先,我们引入 DermoInstruct,一个大规模基于形态学指令语料库,包含211,243张图片和772,675条轨迹,覆盖五种任务格式,完整捕捉从形态学观察、临床推理到最终诊断的完整诊断流程。其次,我们建立了 DermoBench,一个严格的基准测试,评估11项任务涵盖四个临床轴向:形态学、诊断、推理和公平性,其中包括一组具有挑战性的3,600个专家验证的开放式实例和人类绩效基准。最后,我们开发了 DermoGPT,一个进行皮肤学推理 MLLM,通过监督微调 followed by our Morphologically-Anchored Visual-Inference-Consistent (MAVIC) reinforcement learning objective 来训练,该目标 enforces 视觉观察结果与诊断结论之间的一致性。在推理阶段,我们部署 Confidence-Consistency Test-time adaptation (CCT) 以实现稳健的预测。实验表明,DermoGPT 在所有轴向上显著超过16个代表性基线,实现了最佳性能,同时显著缩小了人类-AI之间的差距。DermoInstruct、DermoBench 和 DermoGPT 将在接受录取后发布至 https://github.com/mendicant04/DermoGPT。
引用
@article{arxiv.2601.01868,
title = {DermoGPT: Open Weights and Open Data for Morphology-Grounded Dermatological Reasoning MLLMs},
author = {Jinghan Ru and Siyuan Yan and Yuguo Yin and Yuexian Zou and Zongyuan Ge},
journal= {arXiv preprint arXiv:2601.01868},
year = {2026}
}