我需要多少数据?一项基于医疗数据的案例研究
机器学习
2023-11-28 v1 计算机视觉与模式识别
摘要
为训练深度学习网络而收集数据在精力与资源上代价高昂。在许多情况下,尤其在医疗背景下,可能产生有害影响,例如需要侵入性医疗操作或流程,其本身即可能造成医疗伤害。然而,深度学习被视为一种数据饥渴的方法。在此,我们考察两个广为流传的格言:i) 更多数据带来更好结果;ii) 当你数据不足时迁移学习会帮助你。这些被广泛假定为真,并作为涉及深度学习时选择问题解决方案的依据。我们评估了六个医疗数据集与六个通用数据集。在这些数据集的不同子集上训练ResNet18网络以评估“更多数据带来更好结果”。我们取其中十一个数据集作为迁移学习源,对第十二个数据集——Chest——的子集进行迁移学习,以确定迁移学习是否普遍有益。我们进一步考察多阶段迁移学习是否提供一致收益。我们的分析表明,真实情况比这些简单格言更为复杂——更多数据可能导致收益递减,且为迁移学习错误选择数据集会导致更差性能,某些我们认为与Chest数据集高度相似的数据集反而给出比更不相似数据集更差的结果。多阶段迁移学习同样揭示了数据集间复杂的关系。
引用
@article{arxiv.2311.15331,
title = {How much data do I need? A case study on medical data},
author = {Ayse Betul Cengiz and A. Stephen McGough},
journal= {arXiv preprint arXiv:2311.15331},
year = {2023}
}
备注
10 pages, 7 figures