MMIST-ccRCC:用于多模态系统开发的真实医疗数据集
图像与视频处理
2024-05-06 v1 计算机视觉与模式识别
摘要
获取不同数据模态可以增进我们对各种疾病的了解与认识,为更精准的医疗护理之路。因此,医疗正逐渐向生成大量多模态数据(如分子数据、放射学数据和组织病理学数据)的方向发展。尽管这似乎是一个充分利用数据中心机器学习方法的理想环境,但大多数方法仍只关注单一或少数几种模态的数据,原因包括:i)缺乏即插即用的数据集;ii)难以确定最佳的多模态融合策略;iii)患者之间缺失某些模态数据。本文介绍了一个名为MMIST-ccRCC的数据集,包含来自618名clear cell renal cell carcinoma(ccRCC)患者的2种放射学模态(CT和MRI)、组织病理学、基因组学和临床数据。我们在12个月生存预测任务中提供了单模态和多模态(早期融合和晚期融合)基准测试,在每个患者一个或多个模态缺失的具挑战性场景中进行测试,其中缺失率从基因组数据的最低26%到MRI的90%以上。我们表明,即使存在此类严重缺失率,模态的融合仍可提高生存预测效果。此外,纳入生成缺失模态给定可用模态潜在表征的策略进一步提升了性能,凸显了不同模态之间的潜在互补性。我们的数据集和代码已公开:https://multi-modal-ist.github.io/datasets/ccRCC
引用
@article{arxiv.2405.01658,
title = {MMIST-ccRCC: A Real World Medical Dataset for the Development of Multi-Modal Systems},
author = {Tiago Mota and M. Rita Verdelho and Alceu Bissoto and Carlos Santiago and Catarina Barata},
journal= {arXiv preprint arXiv:2405.01658},
year = {2024}
}
备注
Accepted in DCA in MI Workshop@CVPR2024