通过专家、众包和算法标注肤色以提升皮肤病学图像数据集透明度
计算机视觉与模式识别
2022-07-08 v1 人机交互
机器学习
摘要
尽管人工智能(AI)有望支持医疗保健提供者并提高医疗诊断的准确性,但数据集构成缺乏透明度会使AI模型面临无意且可避免的错误风险。特别是,皮肤病学的公共和私有图像数据集很少包含肤色信息。作为提高透明度的第一步,AI研究人员已将菲茨帕特里克皮肤类型(FST)从衡量患者光敏性的指标,借用为在面部识别和皮肤病诊断等计算机视觉应用的算法审计中估计肤色的指标。为了理解图像上估计的FST标注的变异性,我们在一组来自教科书和在线皮肤病学图集的460张多样化皮肤病图像上比较了几种FST标注方法。我们发现,三位委员会认证的皮肤科医生之间的评分者间信度,与委员会认证的皮肤科医生和两种众包方法之间的评分者间信度相当。相比之下,我们发现转换为FST的个体类型学角度(ITA-FST)方法产生的标注与专家标注的相关性,显著低于专家标注之间的相关性。这些结果表明,基于ITA-FST的算法在标注大规模图像数据集时并不可靠,但以人为本、基于众包的协议可以可靠地为皮肤病学数据集增加皮肤类型透明度。此外,我们引入了具有可调参数(包括专家评审)的动态共识协议概念,这增加了众包工作的可见性,并为未来大规模图像数据集的众包标注提供了指导。
引用
@article{arxiv.2207.02942,
title = {Towards Transparency in Dermatology Image Datasets with Skin Tone Annotations by Experts, Crowds, and an Algorithm},
author = {Matthew Groh and Caleb Harris and Roxana Daneshjou and Omar Badri and Arash Koochek},
journal= {arXiv preprint arXiv:2207.02942},
year = {2022}
}