构建灵活、可扩展且面向机器学习的多模态肿瘤学数据集
机器学习
2023-12-25 v2 人工智能
摘要
数据采集、存储和处理技术的进步导致了异质医疗数据的快速增长。将放射扫描、组织病理学图像和分子信息与临床数据相整合,对于形成对疾病的整体理解和优化治疗至关重要。在癌症等复杂疾病中,整合多源数据的需求更为突出,以实现精准医疗和个性化治疗。本工作提出肿瘤学数据多模态集成系统(MINDS)——一种灵活、可扩展且经济高效的元数据框架,用于将来自癌症研究数据公共库(CRDC)等公共来源的异构数据高效融合为一个相互关联、以患者为中心的框架。MINDS 提供了一个用于探索数据类型间关系并构建队列以开发大规模多模态机器学习模型的接口。通过协调多模态数据,MINDS 旨在潜在地赋予研究人员更强的分析能力,以揭示诊断和预后见解,并实现基于证据的个性化诊疗。MINDS 追踪细粒度的端到端数据溯源,确保可复现性和透明度。MINDS 的云原生架构能够以安全、成本优化的方式处理指数级数据增长,同时确保显著的存储优化、避免重复和动态访问能力。自动扩缩容、访问控制和其他机制保障了管道的可扩展性和安全性。MINDS 通过可互操作的元数据驱动方法克服了现有生物医学数据孤岛的局限,代表了迈向肿瘤学数据集成未来关键的一步。
引用
@article{arxiv.2310.01438,
title = {Building Flexible, Scalable, and Machine Learning-ready Multimodal Oncology Datasets},
author = {Aakash Tripathi and Asim Waqas and Kavya Venkatesan and Yasin Yilmaz and Ghulam Rasool},
journal= {arXiv preprint arXiv:2310.01438},
year = {2023}
}