存在复杂情境因素与同伴群组时用于基准比较的统计机器学习方法
应用统计
2020-11-18 v1
摘要
在个体或组织之间进行公平比较的能力,对于发展稳健且有意义的量化基准至关重要。为进行公平比较,必须考虑情境因素,且比较应仅在相似组织(如同伴群组)之间进行。先前的基准方法使用线性回归来调整情境因素,然而当比较度量与协变量之间存在非线性关系时,线性回归已知是次优的。在本文中,我们提出一种用于基准比较的随机森林模型,可调整这些潜在的非线性关系,并在高噪声数据的案例研究中验证该方法。我们提供拟合模型与比较度量的新可视化及数值摘要,以便分析师与非技术受众解读。比较可在整个队列或同伴群组内部进行,且自助法(bootstrapping)提供了估计调整度量与排名中不确定性的手段。我们得出结论:随机森林模型能够促进组织间量化度量的公平比较,包括在复杂情境因素关系的情况下,且这些模型与输出可被利益相关者轻松解读。
引用
@article{arxiv.2011.08407,
title = {A statistical machine learning approach for benchmarking in the presence of complex contextual factors and peer groups},
author = {Daniel W. Kennedy and Jessica Cameron and Paul P. -Y. Wu and Kerrie Mengersen},
journal= {arXiv preprint arXiv:2011.08407},
year = {2020}
}
备注
18 pages, 8 figures