使用可解释提升机比较生态瞬时评估数据的特殊型与通则型方法
机器学习
2022-04-05 v1
摘要
以往关于精神障碍EMA数据的研究主要聚焦于分别建模每个个体的多元回归方法。本文进一步探索在分类问题中使用非线性可解释机器学习(ML)模型。ML模型可通过识别数据中变量间的复杂模式,增强准确预测不同行为发生的能力。为评估这一点,使用不平衡的合成与真实世界数据集,将各类树集成模型与线性模型的表现进行比较。在考察所有情形下的AUC分数分布后,非线性模型似乎优于基线线性模型。此外,除个性化方法外,群体级预测模型也可能提供增强的表现。据此,考察了两种整合多个个体数据的不同通则型方法,一种在训练中直接使用所有数据,另一种基于知识蒸馏。有趣的是,观察到在其中一个真实世界数据集中,知识蒸馏方法取得了改进的AUC分数(相对于个性化平均相对变化+17%),展示了其如何有益于EMA数据分类与表现。
引用
@article{arxiv.2204.01689,
title = {Using Explainable Boosting Machine to Compare Idiographic and Nomothetic Approaches for Ecological Momentary Assessment Data},
author = {Mandani Ntekouli and Gerasimos Spanakis and Lourens Waldorp and Anne Roefs},
journal= {arXiv preprint arXiv:2204.01689},
year = {2022}
}
备注
13 pages, 2 figures, accepted on the symposium 'Intelligent Data Analysis' (2022)