更安全携手:基于共享事故数据集训练的机器学习模型比企业专用模型更好地预测施工伤害
机器学习
2023-01-10 v1
摘要
在本研究中,我们利用来自 3 个领域 9 家公司的 5.7 万起事故的集体数据集仓库,检验在多个数据集上训练的模型(通用模型)是否比企业专用模型更好地预测安全结果。我们尝试了全通用模型(基于所有数据训练)、按领域通用模型(施工、电力输配、石油天然气),以及通用与专用模型的集成。结果非常积极:通用模型在大多数情况下优于企业专用模型,同时生成更细粒度因而更有用的预测。成功的通用模型免除了训练企业专用模型的需要,节省大量时间与资源,并让事故数据集过于有限而无法训练自身模型的小企业也能获得安全结果预测。然而,通过与企业专用模型集成以获得额外性能提升,训练专用模型可能仍具优势。总体而言,通过从累积经验远超任何单一公司的数据集池中汲取教训,并以简单预测的形式使其易于获取,通用模型攻克了施工行业安全跨组织学习与传播的圣杯。
引用
@article{arxiv.2301.03567,
title = {Safer Together: Machine Learning Models Trained on Shared Accident Datasets Predict Construction Injuries Better than Company-Specific Models},
author = {Antoine J. -P. Tixier and Matthew R. Hallowell},
journal= {arXiv preprint arXiv:2301.03567},
year = {2023}
}
备注
Added paragraph to background