基于机器学习方法的数据驱动材料发现与合成
材料科学
2023-03-20 v2
摘要
经过实验[1-38]和计算[39-50]验证的机器学习(ML)文章根据训练数据规模进行分类:1-100、101-10000和10000+,这是一套总结该领域传统与近期进展的综合性集合。本综述强调合成、表征与预测等相互关联的领域。规模范围1-100主要由贝叶斯优化(BO)文章构成,而101-10000主要由支持向量机(SVM)文章构成。这些文章常结合使用ML、特征选择(FS)、自适应设计(AD)、高通量(HiTp)技术以及领域知识,以提升预测性能和/或模型可解释性。分组交叉验证(G-CV)技术抑制了过于乐观的外推预测性能。依赖AD的较小数据集通常能在受限设计空间中识别具有所需性质的新材料。在较大数据集中,材料优化的易得成果通常已被发现,且模型在外推至新材料时普遍较不成功,尤其当模型训练数据偏向某类特定材料时。大量执行实验或计算验证预测结果的ML材料科学文章的出现,表明了材料信息学与材料科学学科的相互渗透,以及面向实际应用的材料发现正在加速。
引用
@article{arxiv.2202.02380,
title = {Data-Driven Materials Discovery and Synthesis using Machine Learning Methods},
author = {Sterling G. Baird and Marianne Liu and Hasan M. Sayeed and Taylor D. Sparks},
journal= {arXiv preprint arXiv:2202.02380},
year = {2023}
}
备注
43 pages (double-spaced), 12 figures, in press as chapter for Comprehensive Inorganic Chemistry III