一种用于扩充窄数据集并克服临床研究相关挑战的随机重排方法:以心力衰竭队列为例
定量方法
2020-12-15 v1 机器学习
统计方法学
机器学习
摘要
心力衰竭(HF)在全球至少影响 2600 万人,因此预测 HF 患者的不良事件成为临床数据科学的主要目标。然而,由于患者招募困难与随访时间长,获得大样本量有时是一项挑战,并加剧了缺失数据问题。为克服临床数据集基数窄的问题(在临床数据集中,基数指该数据集中的患者数量),群体增强算法因此至关重要。本研究的目的是设计一种随机重排方法,在统计上合法地增强 HF 数据集的基数,而无需特定假设与回归模型。基数的增强通过已建立的随机重复测量方法在预测临床状况与终点的正确性方面进行了验证。特别地,采用机器学习与回归模型来凸显增强数据集的益处。所提出的随机重排方法能够将 HF 数据集基数(预处理前为 711 名患者)增强约 10 倍,若继以随机重复测量方法则约 21 倍。我们认为,当缺失数据与窄数据集基数成为问题时,随机重排方法可用于心血管领域及其他数据科学问题。
引用
@article{arxiv.2012.06784,
title = {A random shuffle method to expand a narrow dataset and overcome the associated challenges in a clinical study: a heart failure cohort example},
author = {Lorenzo Fassina and Alessandro Faragli and Francesco Paolo Lo Muzio and Sebastian Kelle and Carlo Campana and Burkert Pieske and Frank Edelmann and Alessio Alogna},
journal= {arXiv preprint arXiv:2012.06784},
year = {2020}
}