中文

基于对数线性分析的住院费用模型正则化:通过诊断代码合并方法

机器学习 2025-11-10 v2 应用统计 机器学习

摘要

医疗研究中的费用模型必须在可解释性、准确性和参数一致性之间进行平衡。然而,可解释模型往往难以同时实现准确性和一致性。对于高维回归的普通最小二乘(OLS)模型在使用高度细化的ICD-10诊断代码作为预测变量时,虽然可以提高准确性,但会导致回归系数随时间不稳定。这一不稳定性源于许多ICD-10代码在医疗数据集中出现频率较低。虽然正则化方法如Ridge可以解决此问题,但风险在于丢弃重要的预测变量。本文演示了通过诊断代码的细化程度降低(即合并ICD-10代码)作为OLS中的有效正则化策略,可保留所有诊断代码类别的表征。通过将ICD-10代码从七个字符截断到六个字符或更少,我们在降低回归问题的维度的同时,保持了模型的可解释性和一致性。数学上,OLS中预测变量的合并导致Hessian矩阵迹增大,从而降低系数估计的方差。我们的发现解释了为何在现实世界的风险调整和费用模型中,更倾向于使用诊断分组(如DRG和HCC代码),而非高度细化的ICD-10代码。

关键词

引用

@article{arxiv.2507.03843,
  title  = {A Log-Linear Analytics Approach to Cost Model Regularization for Inpatient Stays through Diagnostic Code Merging},
  author = {Chi-Ken Lu and David Alonge and Nicole Richardson and Bruno Richard},
  journal= {arXiv preprint arXiv:2507.03843},
  year   = {2025}
}

备注

Submitted to MLHC 2025