中文

机器学习地质域分类中数据变换效果的实证观察

机器学习 2021-06-11 v1

摘要

文献中大量工作提倡使用对数比变换对成分数据进行多元统计分析。相比之下,很少有研究关注数据变换如何改变地球科学中机器学习分类器的效能。本通讯给出实验结果和实证观察以进一步探讨该问题。目标是研究当使用地球化学数据训练机器学习(ML)分类器/估计器时,数据变换对地质带分类性能的影响。训练输入由取自西澳大利亚 Pilbara 铁矿床的勘探孔化验样本,以及基于地层单元、矿化缺失或存在及类型分配的地质带标签组成。考虑的 ML 技术有多项 logistic 回归、高斯朴素贝叶斯、kNN、线性支持向量分类器、RBF-SVM、梯度提升与极端 GB、随机森林(RF)和多层感知机(MLP)。考察的变换包括等距对数比(ILR)、中心对数比(CLR)结合主成分分析(PCA)或独立成分分析(ICA),以及基于局部线性嵌入(LLE)的流形学习方法。结果显示不同 ML 分类器对这些变换表现出不同敏感性,部分明显优于或劣于其他。总体而言,表现最佳的候选是 ILR,考虑到数据的成分性质这并不意外。成对对数比(PWLR)变换对于提升和 RF 等集成与基于树的 learner 优于 ILR,但对 MLP、SVM 及其他分类器更差。

关键词

引用

@article{arxiv.2106.05855,
  title  = {Empirical observations on the effects of data transformation in machine learning classification of geological domains},
  author = {Raymond Leung},
  journal= {arXiv preprint arXiv:2106.05855},
  year   = {2021}
}

备注

Keywords: Compositional data, supervised learning, geological domain, likelihood estimation, classification performance, effects of data transformation. 10 page article, 2 figures, 7 tables