中文

基于成分与结构的 GGA 带隙机器学习预测方法

材料科学 2023-09-15 v1 计算物理

摘要

本研究致力于开发精确的机器学习(ML)回归模型,基于化学成分与晶体结构预测能带隙值。主要目标是使预测精度与 GGA-PBE 计算所得结果相当,并通过基于密度泛函理论(DFT)的能带结构计算进行验证。我们评估了八种独立的 ML 回归模型,包括 AdaBoost、Bagging、CatBoost、LGBM、RF、DT、GB 和 XGB。使用包含 106,113 种化合物带隙值的数据集,分析了这些模型在多样材料结构与成分上预测 GGA-PBE 带隙值的能力。此外,我们利用 stacking 方法构建了四个集成模型,并利用 bagging 方法构建了七个集成模型。这些集成模型引入了 RidgeCV 和 LassoCV,以探究集成技术是否能提升预测精度。数据集被划分为不同规模的子集:10,000、25,000、50,000 和 100,000 条记录。我们通过置换技术确定了特征重要性,并使用 Pearson 相关方法建立了相关系数矩阵。随机森林(RF)模型在独立模型中表现最佳,取得了 0.943 的 R2 值与 0.504 eV 的 RMSE 值。Bagging 回归在不同数据集规模下通过精简特征选择表现出改进的性能。集成模型,尤其是 bagging,始终优于独立模型,在测试数据集中取得了最佳的 R2 值 0.948 与 RMSE 值 0.479 eV。利用表现最佳的模型,我们预测了具有 18 个价电子计数的新半 Heusler 化合物的带隙值。这些预测通过精确的 DFT 计算成功得到验证。DFT 计算表明,新预测的化合物是具有动力学稳定性的窄带隙半导体。

关键词

引用

@article{arxiv.2309.07424,
  title  = {Composition and Structure Based GGA Bandgap Prediction Using Machine Learning Approach},
  author = {Mukesh K. Choudhary and Amal Raj and Gowri Sankar S and P. Ravindran},
  journal= {arXiv preprint arXiv:2309.07424},
  year   = {2023}
}

备注

17 pages, 17 figures, Research paper