中文

处理重叠非对称数据集——一种双重惩罚 P-Spline 方法

统计方法学 2023-11-21 v2 机器学习 机器学习

摘要

重叠非对称数据集在数据科学中十分常见,并带来如何将其共同纳入预测分析的问题。在医疗数据集中,常有少量信息可用于较多患者(如电子健康记录),但少数患者可能接受了广泛的进一步检查。若较小队列与较大样本在规模上差异显著,诸如缺失值插补等常见解决方案往往不明智,因此本研究旨在开发一种新方法,能在针对特定响应建模较小队列的同时考虑较大队列。受非参数模型尤其是通过广义加性模型的灵活平滑技术启发,我们建模了一种双重惩罚 P-Spline 近似方法,首先防止较小队列的过拟合/欠拟合,其次考虑较大队列。这第二项惩罚由存在于较小与较大队列中协变量的边际值差异所构建。通过数据模拟、参数调优及考虑连续与二元响应的模型适配,我们发现双重惩罚方法相较线性 B-Spline 与一次惩罚 P-Spline 近似提供了增强的拟合。应用于与个体患非酒精性脂肪性肝炎风险相关的真实数据集时,我们观察到超过 65% 的模型拟合性能提升。该领域的未来工作包括使我们的方法无需降维并考虑参数建模方法。然而,据我们所知,这是首项在灵活回归中提出额外边际惩罚的工作,我们可报告其大幅改善的模型拟合能力,能够考虑非对称数据集而无需缺失数据插补。

关键词

引用

@article{arxiv.2311.10489,
  title  = {Handling Overlapping Asymmetric Datasets -- A Twice Penalized P-Spline Approach},
  author = {Matthew McTeer and Robin Henderson and Quentin M Anstee and Paolo Missier},
  journal= {arXiv preprint arXiv:2311.10489},
  year   = {2023}
}

备注

52 pages, 17 figures, 8 tables, 34 references