构建 RadiologyNET:大规模多模态医学数据库的无监督标注
计算机视觉与模式识别
2023-08-17 v1 机器学习
摘要
背景与目的:近年来,通过开发常依赖于标注医学放射图像的计算机辅助诊断系统,机器学习在医学诊断和治疗中的使用显著增长。然而,大型标注图像数据集的可用性仍是一大障碍,因为标注过程耗时且昂贵。本文探讨了如何根据语义相似性自动标注医学放射图像数据库。材料与方法:采用自动化的无监督方法,利用包括图像、DICOM 元数据和叙述性诊断在内的多模态来源,构建源自克罗地亚里耶卡临床医院中心的大型标注医学放射图像数据集。针对每种数据源测试了若干合适的特征提取器,并使用 k-means 和 k-medoids 聚类在代表性数据子集上评估其效用。结果:随后将最优特征提取器整合为多模态表示,再进行聚类,从而创建一个自动流水线,将 1,337,926 张医学图像的 precursor 数据集标注为 50 个视觉相似图像簇。通过考察各簇的同质性与互信息,并考虑解剖区域与模态表示,评估了簇的质量。结论:结果表明,将三种数据源的嵌入融合在一起最适用于大规模医学数据的无监督聚类任务,产生最紧凑的簇。因此,本工作是构建更大型、更细粒度标注医学放射图像数据集的第一步。
引用
@article{arxiv.2308.08517,
title = {Building RadiologyNET: Unsupervised annotation of a large-scale multimodal medical database},
author = {Mateja Napravnik and Franko Hržić and Sebastian Tschauner and Ivan Štajduhar},
journal= {arXiv preprint arXiv:2308.08517},
year = {2023}
}