中文

面向皮肤科的基础模型分层基准测试

计算机视觉与模式识别 2026-01-21 v1

摘要

基础模型通过提供鲁棒的特征表示,减少了对大规模任务特定训练的需求,从而改变了医学图像分析。然而,当前皮肤科的基准测试通常将复杂的诊断分类法简化为扁平的二分类任务,例如区分黑色素瘤与良性痣。这种过度简化掩盖了模型执行细粒度鉴别诊断的能力,而这对于临床工作流程整合至关重要。本研究评估了来自十个基础模型(涵盖通用计算机视觉、通用医学成像和皮肤科特定领域)的嵌入在分层皮肤病变分类中的效用。使用包含40个病变子类的DERM12345数据集,我们计算了冻结嵌入,并使用五折交叉验证训练了轻量级适配器模型。我们引入了一个分层评估框架,该框架在四个临床粒度级别上评估性能:40个子类、15个主类、2个和4个超类以及二元恶性。我们的结果揭示了模型能力中的“粒度差距”:MedImageInsights在二元恶性检测上取得了最强的整体性能(97.52%加权F1分数),但在细粒度的40类亚型分类上下降到65.50%。相反,MedSigLip(69.79%)和皮肤科特定模型(Derm Foundation和MONET)在细粒度的40类亚型判别上表现出色,但在更广泛的分类任务上整体性能低于MedImageInsights。我们的研究结果表明,虽然通用医学基础模型对于高级筛查非常有效,但诊断支持系统所需的细粒度区分需要专门的建模策略。

关键词

引用

@article{arxiv.2601.12382,
  title  = {A Hierarchical Benchmark of Foundation Models for Dermatology},
  author = {Furkan Yuceyalcin and Abdurrahim Yilmaz and Burak Temelkuran},
  journal= {arXiv preprint arXiv:2601.12382},
  year   = {2026}
}