用于精确材料属性预测的最优预训练/微调策略
材料科学
2024-12-24 v1
摘要
克服材料科学中有限数据可用性的挑战对于机器学习在材料科学中的广泛应用至关重要。克服这种有限数据可用性的一种途径是使用迁移学习(TL)框架,其中预训练(PT)的机器学习模型(在较大数据集上)可以在目标(通常较小)数据集上进行微调(FT)。我们的研究系统地探索了各种PT/FT策略在有限数据下学习和预测材料属性的有效性。具体来说,我们利用图神经网络(GNN)在七个不同的精选材料数据集上进行PT/FT,这些数据集的大小从941到132,752个数据点不等。我们考虑的数据集涵盖了一系列材料属性,从带隙(电子属性)到形成能(热力学属性)和剪切模量(机械属性)。我们研究了PT和FT数据集大小、可用于FT的策略以及其他超参数对所考虑数据集之间成对TL的影响。我们发现,我们的成对PT-FT模型在目标数据集上的表现始终优于从头开始训练的模型。重要的是,我们开发了一个同时在多个属性上进行PT的GNN框架(MPT),从而能够构建通用的GNN模型。我们的MPT模型在几个所考虑的数据集上优于成对PT-FT模型,并且在一个与PT数据集完全分布外部的二维材料带隙数据集上表现更为显著。最后,我们期望我们的PT/FT和MPT框架能够推广到其他GNN和材料属性,从而加速各种应用中的材料设计和发现。
引用
@article{arxiv.2406.13142,
title = {Optimal pre-train/fine-tune strategies for accurate material property predictions},
author = {Reshma Devi and Keith T. Butler and Gopalakrishnan Sai Gautam},
journal= {arXiv preprint arXiv:2406.13142},
year = {2024}
}