皮肤病学 AI 在多样化精选临床图像集上的性能差异
图像与视频处理
2022-09-28 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
获得皮肤病学诊疗是一个重大问题,估计全球有 30 亿人缺乏诊疗机会。人工智能(AI)可能有助于皮肤疾病的分诊。然而,大多数 AI 模型尚未在多样化肤色或不常见疾病的图像上得到严格评估。为确定此类背景下算法性能的潜在偏差,我们策划了多样化皮肤病学图像(DDI)数据集——首个公开可用、专家策划且经病理确认、具有多样化肤色的数据集。使用该包含 656 张图像的数据集,我们表明最先进的皮肤病学 AI 模型在 DDI 上表现明显更差,其受试者工作特征曲线下面积(ROC-AUC)相比模型原始测试结果下降了 27–36%。所有模型在深肤色和不常见疾病(DDI 数据集中有所体现)上表现更差。此外,我们发现通常为 AI 训练和测试数据集提供视觉标签的皮肤科医生,相比活检真值标注,在深肤色和不常见疾病图像上也表现更差。最后,在特征明确且多样化的 DDI 图像上对 AI 模型进行微调,缩小了浅肤色与深肤色之间的性能差距。而且,在多样化肤色上微调的算法在识别深肤色图像中的恶性肿瘤方面优于皮肤科医生。我们的发现指出了皮肤病学 AI 中需解决的重要缺陷与偏差,以确保其对多样化患者和疾病的可靠应用。
引用
@article{arxiv.2203.08807,
title = {Disparities in Dermatology AI Performance on a Diverse, Curated Clinical Image Set},
author = {Roxana Daneshjou and Kailas Vodrahalli and Roberto A Novoa and Melissa Jenkins and Weixin Liang and Veronica Rotemberg and Justin Ko and Susan M Swetter and Elizabeth E Bailey and Olivier Gevaert and Pritam Mukherjee and Michelle Phung and Kiana Yekrang and Bradley Fong and Rachna Sahasrabudhe and Johan A. C. Allerup and Utako Okata-Karigane and James Zou and Albert Chiou},
journal= {arXiv preprint arXiv:2203.08807},
year = {2022}
}