基于深度学习的 OCT 图像分类中因数据泄漏导致的测试精度虚高
图像与视频处理
2022-09-29 v2 计算机视觉与模式识别
机器学习
摘要
在光学相干断层扫描(OCT)数据的深度学习应用中,使用源自体数据的二维图像训练分类网络十分常见。鉴于 OCT 系统的微米级分辨率,连续图像在可见结构与噪声上往往非常相似。因此,不适当的数据划分会导致训练集与测试集之间的重叠,而大量文献忽视了这一点。本研究针对三个被广泛使用的 OCT 开放获取数据集——Kermany 眼科数据集、Srinivasan 眼科数据集及 AIIMS 乳腺组织数据集,展示了不适当的数据集划分对模型评估的影响,涉及三项分类任务。结果表明,在不适当划分的数据集上测试的模型,其分类性能按 Matthews 相关系数计被虚高了 0.07 至 0.43(准确率:5% 至 30%),凸显了数据集处理对模型评估的显著影响。鉴于在 OCT 数据上应用深度学习的研究兴趣日益增长,本研究旨在提高对数据集划分重要性的认识。
引用
@article{arxiv.2202.12267,
title = {Inflation of test accuracy due to data leakage in deep learning-based classification of OCT images},
author = {Iulian Emil Tampu and Anders Eklund and Neda Haj-Hosseini},
journal= {arXiv preprint arXiv:2202.12267},
year = {2022}
}
备注
8 pages, 2 figures