中文

当AI与专家在错误上一致:皮肤镜图像中的内在模糊性

计算机视觉与模式识别 2026-04-02 v1

摘要

人工智能(AI),特别是卷积神经网络(CNN),在皮肤病学诊断中的集成展示了显著的临床潜力。虽然现有文献主要将算法性能与人类专家进行基准比较,但我们的研究采用了一种新视角,通过调查皮肤镜图像的内在复杂性。在使用多种CNN架构的严格实验中,我们分离出了一组在所有模型中被系统性误分类的图像——这一现象被统计证明超越了随机机会。为了确定这些失败是源于算法偏差还是固有的视觉模糊性,皮肤病学专家独立地评估了这些具有挑战性的病例以及一组对照组。结果显示,人类诊断性能在AI误分类的图像上出现了崩溃。首先,与真实标签的一致性急剧下降,Cohen's kappa在困难图像上仅为0.08,而对照组为0.61。其次,我们观察到专家共识的严重恶化;医生之间的评分者间可靠性从对照图像上的中度一致性(Fleiss kappa = 0.456)降至困难病例上的仅适度一致(Fleiss kappa = 0.275)。我们确定图像质量是这些双重系统性失败的主要驱动因素。为了促进透明度和可重复性,所有数据、代码和训练模型均已公开发布。

关键词

引用

@article{arxiv.2604.00651,
  title  = {When AI and Experts Agree on Error: Intrinsic Ambiguity in Dermatoscopic Images},
  author = {Loris Cino and Pier Luigi Mazzeo and Alessandro Martella and Giulia Radi and Renato Rossi and Cosimo Distante},
  journal= {arXiv preprint arXiv:2604.00651},
  year   = {2026}
}