应用于胃肠道异常分类的机器学习跨数据集偏差与评估指标解释的深入研究
机器学习
2021-02-03 v1 多媒体
机器学习
摘要
精确高效的胃肠道(GI)道疾病自动识别可以帮助医生治疗更多患者,并提高疾病检测和识别率。目前,胃肠道疾病的自动分析是计算机科学和医学相关期刊的热门话题。然而,对这种自动分析的评估往往是不完整的或完全错误的。算法通常仅在小规模且有偏差的数据集上进行测试,且很少进行跨数据集评估。清晰理解评估指标和机器学习模型在跨数据集上的表现,对于将该领域研究提升至新的质量水平至关重要。为此,我们使用全局特征和深度神经网络对五种不同的机器学习模型进行了全面评估,这些模型能够对16种不同关键类型的胃肠道状况进行分类,包括病理发现、解剖标志、息肉切除状况以及常见胃肠道检查仪器捕获图像中的正常发现。在评估中,我们引入了使用召回率、精确率、特异性、准确率、F1分数和Matthews相关系数等六项性能指标的性能六边形,以展示如何确定模型的真实能力,而非对其进行浅层评估。此外,我们使用不同的数据集进行训练和测试,以执行跨数据集评估。通过这些跨数据集评估,我们展示了构建可跨不同医院使用的泛化模型的实际挑战。我们的实验清楚地表明,需要应用更复杂的性能指标和评估方法来获得可靠的模型,而不是依赖于同一数据集的划分评估,即性能指标应始终结合解释,而不是依赖单一指标。
引用
@article{arxiv.2005.03912,
title = {An Extensive Study on Cross-Dataset Bias and Evaluation Metrics Interpretation for Machine Learning applied to Gastrointestinal Tract Abnormality Classification},
author = {Vajira Thambawita and Debesh Jha and Hugo Lewi Hammer and Håvard D. Johansen and Dag Johansen and Pål Halvorsen and Michael A. Riegler},
journal= {arXiv preprint arXiv:2005.03912},
year = {2021}
}
备注
30 pages, 12 figures, 8 tables, Accepted for ACM Transactions on Computing for Healthcare