基于UMAP的大规模放射学数据集异常检测
图像与视频处理
2024-08-02 v2 计算机视觉与模式识别
摘要
机器学习算法的成功程度严重依赖于样本质量及其标签的准确性。然而,构建和维护大型高质量数据集是一个巨大的任务。这在生物医学数据及由较小数据集编译而成的元数据集中尤为如此,因为图像质量、标注、报告和归档的差异可能导致错误、不一致和重复样本。本文展示了统一流形近似和投影(UMAP)算法如何通过形成与主要(良好)数据截然不同的独立聚类来发现这些异常,这些聚类虽然与具有相同错误类型的其他点相似。作为一个代表性例子,我们将UMAP应用于发现ChestX-ray14、CheXpert和MURA数据集中的异常值。虽然这些结果是归档性和回顾性的,主要针对放射学图像,但基于图的方法适用于任何数据类型,在数据集创建时将对数据标注同样有益。
引用
@article{arxiv.2407.21263,
title = {Outlier Detection in Large Radiological Datasets using UMAP},
author = {Mohammad Tariqul Islam and Jason W. Fleischer},
journal= {arXiv preprint arXiv:2407.21263},
year = {2024}
}
备注
Accepted in MICCAI-2024 Workshop on Topology- and Graph-Informed Imaging Informatics (TGI3)