中文

利用聚类方法改进新西兰儿童福利系统预测性风险建模

机器学习 2023-08-09 v1 机器学习

摘要

临床判断与预测性风险模型的结合,关键地协助社会工作者区分面临虐待风险的儿童,并决定当局何时介入。利用行政数据与机器学习算法开展预测性风险建模以解决此问题,已由全球若干政府福利机构发起。尽管既往研究已考察与儿童虐待相关的风险因素,但在理解此类风险因素如何相互作用、以及预测性风险模型对具有不同特征的儿童是否表现不同方面,仍存在若干空白。通过整合主成分分析(PCA)与 K-Means 聚类,本文呈现了我们工作中关于识别此类特征及其对当前风险建模框架潜在影响的初步发现。该方法允许考察新西兰(NZ)被报告有照护与保护问题的儿童中既存却尚未识别的聚类,分析其内部结构,并评估按聚类训练的预测模型表现。我们旨在发现作为开发儿童虐待预测性风险模型早期步骤所需的聚类程度,从而提升供儿童保护当局使用的此类模型准确性。在已识别聚类上训练 LASSO 逻辑回归模型的测试结果显示其表现无显著差异。然而,模型在包含两个较年轻儿童聚类的情形下表现略好。我们的结果表明,可能需要为特定年龄儿童开发独立模型,以额外控制错误率并提升模型准确性。尽管结果令人鼓舞,仍需更多证据以得出确定结论,且有必要进一步研究。

关键词

引用

@article{arxiv.2308.04060,
  title  = {Toward Improving Predictive Risk Modelling for New Zealand's Child Welfare System Using Clustering Methods},
  author = {Sahar Barmomanesh and Victor Miranda-Soberanis},
  journal= {arXiv preprint arXiv:2308.04060},
  year   = {2023}
}

备注

20 pages, 5 figures, 6 tables