多孔材料中的大数据科学:材料基因组学与机器学习
材料科学
2020-06-12 v3 机器学习
摘要
通过将金属节点与有机连接体组合,我们潜在可合成数百万种可能的金属有机框架(MOFs)。目前,我们拥有超过一万种已合成材料的库以及数百万种计算机预测的材料的库。我们拥有如此众多材料这一事实开辟了诸多令人振奋的途径,以量身定制对给定应用最优的材料。然而,从实验和计算的角度看,我们拥有的材料过多,无法使用暴力筛选技术进行筛选。在本综述中,我们展示拥有如此众多材料使我们能够将大数据方法用作研究这些材料并发现复杂关联的强大技术。综述的第一部分介绍了大数据科学的原理。我们强调数据收集的重要性、扩充小数据集的方法,以及如何选择合适的训练集。本综述的一个重要部分是用于在特征空间中表示这些材料的不同方法。综述还包括对不同机器学习(ML)技术的总体概述,但由于多孔材料中的大多数应用使用监督式 ML,我们的综述聚焦于监督式 ML 的不同方法。特别地,我们回顾了优化 ML 过程的不同方法以及如何量化不同方法的性能。在第二部分,我们回顾了 ML 的不同方法如何应用于多孔材料。特别地,我们讨论了在气体存储与分离、这些材料的稳定性、其电子性质及其合成领域的应用。所述主题的范围说明了可利用大数据科学研究的大量多样的话题。鉴于科学界对 ML 日益增长的兴趣,我们预期该列表在未来几年将迅速扩展。
引用
@article{arxiv.2001.06728,
title = {Big-Data Science in Porous Materials: Materials Genomics and Machine Learning},
author = {Kevin Maik Jablonka and Daniele Ongari and Seyed Mohamad Moosavi and Berend Smit},
journal= {arXiv preprint arXiv:2001.06728},
year = {2020}
}
备注
Editorial changes (typos fixed, minor adjustments to figures)