健康技术中的方法论优先性:为何机器学习/大数据分析必须遵循基本流行病学一致性——案例研究
机器学习
2025-12-15 v2
摘要
高级分析工具,包括机器学习(ML)和大规模数据处理的集成,已彻底改变了健康研究,承诺实现诊断和风险预测的前所未有的准确性。然而,这些复杂方法的严谨性根本上取决于底层数据集的质量和完整性,以及其统计设计的有效性。我们提出了一个典型案例:高级分析(ML/大数据)必须在验证基本方法论一致性并遵循既定医学协议(如STROBE声明)之后才能进行。该研究强调了一个关键警示原则:复杂的分析放大而非纠正根植于基本设计选择的严重方法论缺陷,导致误导性或矛盾的发现。通过应用于最近一项关于新冠病毒疫苗结果和严重不良事件(如癌症)的队列研究,对简单、标准的描述性统计方法和既定流行病学基准进行分析,我们揭示了多个不可调和的统计悖论。这些悖论具体表现为:在暴露子群中癌症发生率增加,而整体粗发生率却低于国家标准,这些悖论最终否定了报告的总体癌症风险增加。我们证明,观察到的效应是源于队列构建中未纠正的选择偏差所致的数学artifact。这一分析提醒人们,即便是最复杂的健康研究,也必须首先通过基本流行病学一致性的考验,才能使后续高级统计建模所得的结论具有有效性和可发表性。
引用
@article{arxiv.2511.07500,
title = {Methodological Precedence in Health Tech: Why ML/Big Data Analysis Must Follow Basic Epidemiological Consistency. A Case Study},
author = {Marco Roccetti},
journal= {arXiv preprint arXiv:2511.07500},
year = {2025}
}
备注
6 Tables; ML/Big data paper on medical data