中文

基于机器学习技术在不平衡大型数据集上钻进漏失事件分类的案例研究

机器学习 2022-09-08 v2 地球物理

摘要

本研究提出机器学习模型,利用大型类不平衡钻进数据集前瞻性地预测并分类漏失严重程度。我们展示了利用易解释的机器学习方法解决大型钻探工程挑战所涉及的可复现核心技术。我们使用了来自伊朗Azadegan油田地层的65,000余条具有类不平衡问题的数据。从数据集的十七个参数中选取十一个用于五类漏失事件的分类。为生成分类模型,我们使用了六种基础机器学习算法和四种集成学习方法。六种基础技术为线性判别分析(LDA)、逻辑回归(LR)、支持向量机(SVM)、分类与回归树(CART)、k近邻(KNN)和高斯朴素贝叶斯(GNB)。我们还使用了装袋和提升集成学习技术来探究改进预测性能的解决方案。使用准确率、精确率、召回率和F1-score四项指标衡量这些算法的性能。选择加权以表示数据不平衡的F1-score作为首选评价标准。发现CART模型在识别钻井液循环漏失事件方面为同类最佳,平均加权F1-score为0.9904,标准差为0.0015。应用集成学习技术后,随机森林决策树集成展现出最佳预测性能。它以完美的加权F1-score 1.0识别并分类了漏失事件。使用置换特征重要性(PFI),发现测量深度是准确识别钻进中漏失事件的最具影响因子。

关键词

引用

@article{arxiv.2209.01607,
  title  = {A Case Study on the Classification of Lost Circulation Events During Drilling using Machine Learning Techniques on an Imbalanced Large Dataset},
  author = {Toluwalase A. Olukoga and Yin Feng},
  journal= {arXiv preprint arXiv:2209.01607},
  year   = {2022}
}

备注

21 pages