中文

用于从多模态生活日志数据进行可解释个性化健康预测的主体自适应稀疏线性模型

机器学习 2026-03-23 v1

摘要

从多模态生活日志数据中改进对个性化健康结果(如睡眠质量和压力)的预测,可能具有有意义的临床和实际意义。然而,最先进的模型(主要是深度神经网络和梯度提升集成模型)牺牲了可解释性,并且未能充分解决生活日志数据中固有的显著个体间差异。为了克服这些挑战,我们提出了主体自适应稀疏线性(SASL)框架,这是一种明确为个性化健康预测设计的可解释建模方法。SASL 将普通最小二乘回归与主体特定的交互作用相集成,系统地区分全局效应与个体水平效应。我们采用基于嵌套 FF 检验的迭代后向特征消除方法,以构建稀疏且统计稳健的模型。此外,认识到健康结果通常代表连续过程的离散化版本,我们开发了一种回归后阈值化方法,专门设计用于最大化有序目标的宏平均 F1 分数。对于本质上具有挑战性的预测,SASL 通过基于置信度的门控选择性地结合紧凑 LightGBM 模型的输出,在不损害可解释性的情况下提高准确性。在 CH-2025 数据集(包含来自十名受试者约 450 个日常观测值)上进行的评估表明,混合 SASL-LightGBM 框架实现了与复杂黑盒方法相当的预测性能,但参数显著更少,透明度大幅提高,从而为临床医生和从业者提供清晰且可操作的见解。

关键词

引用

@article{arxiv.2510.02835,
  title  = {Subject-Adaptive Sparse Linear Models for Interpretable Personalized Health Prediction from Multimodal Lifelog Data},
  author = {Dohyun Bu and Jisoo Han and Soohwa Kwon and Yulim So and Jong-Seok Lee},
  journal= {arXiv preprint arXiv:2510.02835},
  year   = {2026}
}

备注

6 pages, ICTC 2025