中文

假设精简且数据自适应的预测后推断

统计方法学 2024-09-17 v4 机器学习 机器学习

摘要

现代科学研究面临的一个主要挑战是金标准数据的有限可用性,这类数据获取成本高昂、劳动密集或具有侵入性。随着机器学习(ML)的快速发展,科学家现在可以使用ML算法以更易获取的变量来预测金标准结果。然而,这些预测结果往往被直接用于后续统计分析,忽略了预测过程引入的不精确性和异质性。这很可能导致假阳性发现和不科学的结论。在这项工作中,我们引入了预测后自适应推断(PSPA),它允许基于ML预测数据进行有效且有力的推断。其“假设精简”特性保证了无需对ML预测作假设即可进行可靠统计推断。其“数据自适应”特性保证了相较于现有方法的效率提升,无论ML预测的准确性如何。我们通过模拟和真实数据应用展示了我们方法的统计优越性和广泛适用性。

关键词

引用

@article{arxiv.2311.14220,
  title  = {Assumption-Lean and Data-Adaptive Post-Prediction Inference},
  author = {Jiacheng Miao and Xinran Miao and Yixuan Wu and Jiwei Zhao and Qiongshi Lu},
  journal= {arXiv preprint arXiv:2311.14220},
  year   = {2024}
}