皮肤游戏:革新 AI 皮肤病学模型比较的标准
图像与视频处理
2025-02-05 v1 计算机视觉与模式识别
组织与器官
摘要
深度学习方法在皮肤病学图像分类中取得了令人鼓舞的成果,但该领域面临着显著的方法论挑战,阻碍了对模型评估的进行。本文提出了双重贡献:首先,对当前皮肤病分类研究中的方法论实践进行系统性分析,揭示了数据准备、数据增强策略和绩效报告方面的重大不一致性;其次,通过在三个基准数据集(HAM10000、DermNet、ISIC Atlas)上使用 DINOv2-Large 大型视觉变换器进行训练和评估,构建了一套全面的训练和评估框架。分析识别出担忧的模式,包括数据分割前的数据增强和基于验证集的报告,可能导致指标被高估,同时突显了缺乏统一方法论标准的现状。实验结果表明,DINOv2 在皮肤病分类中的性能分别达到宏平均 F1 分数为 0.85(HAM10000)、0.71(DermNet)和 0.84(ISIC Atlas)。注意力图分析揭示了模型决策中的关键模式,显示该模型在典型表现形式下能够识别出 sophisticated 的特征,但在非典型病例和组合图像方面存在显著脆弱性。我们的发现凸显了在临床环境中需要标准化评估协议以及小心谨慎的实施策略。我们提出了涵盖模型开发、评估和临床部署的全面方法论建议,强调严格的数据准备、系统性的错误分析以及针对不同图像类型的专门化协议。为促进可重复性,我们通过 GitHub 提供了我们的实现代码。本工作为皮肤病学图像分类中的严格评估标准奠定了基础,并为临床皮肤病学中的负责任 AI 实施提供了见解。
引用
@article{arxiv.2502.02500,
title = {The Skin Game: Revolutionizing Standards for AI Dermatology Model Comparison},
author = {Łukasz Miętkiewicz and Leon Ciechanowski and Dariusz Jemielniak},
journal= {arXiv preprint arXiv:2502.02500},
year = {2025}
}
备注
60 pages, 69 figures