虚假数据如何影响电化学中的机器学习模型?
机器学习
2024-01-25 v2 化学物理
摘要
近来,机器学习模型的选择仅基于数据分布而未关注数据噪声。本研究旨在甄别哪些模型在含噪数据下表现良好,并确立堆叠机器学习模型是否确实能为原本抗噪弱的模型提供鲁棒性。电化学数据使用12个独立模型与堆叠模型进行测试,包括XGB、LGBM、RF、GB、ADA、NN、ELAS、LASS、RIDGE、SVM、KNN、DT以及堆叠模型。研究发现,线性模型在100%加噪下以(斜率)平均误差至1.75 F g-1良好处理噪声;但在0%加噪最小误差下估计平均达60.19 F g-1,因而受制于预测精度。树基模型在噪声处理上失败(100%噪声下平均斜率为55.24 F g-1),但可提供比线性更高的预测精度(最低误差23.9 F g-1)。为解决预测精度与误差处理间的矛盾,构建了堆叠模型,其不仅展现高准确度(截距25.03 F g-1),且表现出良好噪声处理(斜率43.58 F g-1),使堆叠模型成为电化学中初学者与经验机器学习研究者的相对低风险可行选择。尽管神经网络(NN)在电化学领域日益流行,本研究却表明NN不适用于电化学数据,且不当调优会导致模型易受噪声影响。因此,STACK模型应提供更好收益:即便基模型未调优,也能达成准确且抗噪的模型。总体而言,本工作为电化学数据的机器学习模型选择提供洞见,应有助于理解化学语境下的数据科学。
引用
@article{arxiv.2311.10795,
title = {How False Data Affects Machine Learning Models in Electrochemistry?},
author = {Krittapong Deshsorna and Luckhana Lawtrakul and Pawin Iamprasertkun},
journal= {arXiv preprint arXiv:2311.10795},
year = {2024}
}
备注
40 pages, 11 figures