中文

(解)构皮肤病变数据集中的偏差

计算机视觉与模式识别 2026-04-21 v1

摘要

黑色素瘤是最致命的皮肤癌。自动化皮肤病变分析对早期检测起着重要作用。如今,ISIC Archive与Atlas of Dermoscopy数据集是最常用于评测基于深度学习的工具皮肤病变来源。然而,所有数据集都包含偏差,常因采集与标注方式而无意产生。这些偏差扭曲了机器学习模型的性能,制造出模型可不公平利用的伪相关,或相反破坏了模型本可学习的合理相关。本文中,我们提出一组实验,揭示现有皮肤病变数据集中正负两类偏差。我们的结果显示,模型可在无临床意义信息下正确分类皮肤病变图像:令人不安的是,在去除了病变信息的图像上训练的机器学习模型,其准确率高于由皮肤科医生表现筛选的AI基准。这强烈暗示伪相关在引导模型。我们向模型输入额外的临床有意义信息,却未能哪怕略微改善结果,表明合理相关被破坏。我们的主要发现提升了对在小型数据集(如我们所评测者)上训练与评估模型局限性的认识,并可能为面向真实部署的模型提供未来指导。

关键词

引用

@article{arxiv.1904.08818,
  title  = {(De)Constructing Bias on Skin Lesion Datasets},
  author = {Alceu Bissoto and Michel Fornaciali and Eduardo Valle and Sandra Avila},
  journal= {arXiv preprint arXiv:1904.08818},
  year   = {2026}
}

备注

9 pages, 6 figures. Paper accepted at 2019 ISIC Skin Image Anaylsis Workshop @ IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)