通过探索皮肤病变数据集中的偏置改进病灶检测
图像与视频处理
2020-11-22 v1 计算机视觉与模式识别
机器学习
摘要
所有数据集都包含一些偏置,常因采集与标注方式而无意引入。这些偏置会扭曲机器学习模型的性能,造成模型可不公平利用的伪相关,或反之破坏模型本可学习的明确相关。随着深度学习模型的流行,自动化皮肤病变分析在黑色素瘤早期检测中开始发挥重要作用。ISIC Archive 是最常用的皮肤病变来源之一,用于基准测试基于深度学习的工具。Bissoto 等人实验了不同的基于边界框的掩码,表明深度学习模型可在输入数据无临床意义信息的情况下对皮肤病变图像分类。他们的发现看似反常,因为被剔除区域(随机矩形框)并不显著。病灶形状是皮肤病变临床表征的关键因素。在此背景下,我们进行了一组实验,生成保形掩码而非基于矩形边界框的掩码。在这些保形掩码图像上训练的深度学习模型,并未优于在无临床意义信息图像上训练的模型。这强烈暗示有伪相关在引导模型。我们提出使用生成对抗网络(GAN)来缓解潜在偏置。
引用
@article{arxiv.2010.01485,
title = {Improving Lesion Detection by exploring bias on Skin Lesion dataset},
author = {Anusua Trivedi and Sreya Muppalla and Shreyaan Pathak and Azadeh Mobasher and Pawel Janowski and Rahul Dodhia and Juan M. Lavista Ferres},
journal= {arXiv preprint arXiv:2010.01485},
year = {2020}
}