中文

调查感知的机器学习:基于范围综述的有效人群健康推断指南

机器学习 2026-05-12 v1 机器学习

摘要

在诸如国家健康与营养调查(NHANES)等复杂健康调查数据上训练的机器学习(ML)模型,常常忽略初级抽样单元、分层变量和抽样权重。这种做法违反了标准评估方法的独立性假设。结果导致估计有偏、不确定性被低估,且公平性评估无法反映人群层面的差异。我们提出了“调查感知的机器学习”(SaML),这是一个九步指南,将调查设计元数据整合到机器学习生命周期中。通过对16篇方法论论文的范围综述,我们总结了在加权模型训练、基于设计的交叉验证和调查调整的性能评估方面的现有工作。我们还识别了超参数调优和部署方面的空白。我们提供了针对特定任务的指导,阐明了不同分析目标需要哪些步骤。SaML 为从调查数据中进行有效的人群推断提供了一个检查清单。

关键词

引用

@article{arxiv.2605.08963,
  title  = {Survey-aware Machine Learning: A Guideline for Valid Population Health Inference based on Scoping Review},
  author = {YongKyung Oh and Henry W. Zheng and Jeffrey Feng and Alex A. T. Bui},
  journal= {arXiv preprint arXiv:2605.08963},
  year   = {2026}
}