通过溯源与大文件管理增强临床数据仓库:面向临床组学数据的 gitOmmix 方法
定量方法
2024-09-06 v1
摘要
背景。临床数据仓库(CDWs)在医院数据的观察性研究或预测建模的再利用中至关重要。然而,最先进的 CDW 系统存在两个缺点。首先,它们不支持大型数据文件的管理,这在医学基因组学、放射学、数字病理学以及其他生成此类文件的领域中是至关重要的。其次,它们不提供溯源管理或表示患者事件之间纵向关系的手段。事实上,疾病的诊断及其随访依赖于多项分析。在这些情况下,无法记录数据(例如大文件)与其相关分析和决策之间的关系。方法。我们引入了 gitOmmix,一种克服这些限制的方法,并展示了其在医学组学数据管理中的实用性。gitOmmix 依赖于 (i) 一个文件版本控制系统:git,(ii) 一个处理大文件的扩展:git-annex,(iii) 一个溯源知识图谱:PROV-O,以及 (iv) git 版本信息与溯源知识图谱之间的对齐。结果。继承自 git 和 git-annex 的能力使得能够通过支持数据和分析,将临床解释的历史追溯回患者样本。此外,与 git 版本信息对齐的溯源知识图谱能够查询和浏览这些元素之间的溯源关系。结论。gitOmmix 为 CDWs 增加了一个溯源层,同时能够扩展至大文件并且与 CDW 系统无关。由于这些原因,我们认为它是组学临床研究的一种可行且可推广的解决方案。
引用
@article{arxiv.2409.03288,
title = {Enhancing Clinical Data Warehouses with Provenance and Large File Management: The gitOmmix Approach for Clinical Omics Data},
author = {Maxime Wack and Adrien Coulet and Anita Burgun and Bastien Rance},
journal= {arXiv preprint arXiv:2409.03288},
year = {2024}
}