中文

基于持续同调与化学词嵌入的机器学习提升金属有机框架的预测精度与可解释性

材料科学 2021-04-01 v2 机器学习 代数拓扑 计算物理

摘要

机器学习已成为材料发现中的一种强有力方法。其主要挑战在于选择能够创建材料可解释表示、并对多种预测任务均有用的特征。我们引入了一种端到端机器学习模型,可自动生成捕捉材料结构与化学复杂表示的 descriptors(描述符)。该方法建立在计算拓扑技术(即持续同调)和自然语言处理中的词嵌入之上,直接从材料体系中自动封装几何与化学信息。我们在多个纳米多孔金属有机框架数据集上展示了该方法,预测了不同条件下的甲烷与二氧化碳吸附。结果表明,与基于常用人工策展特征构建的模型相比,我们的方法在精度与跨目标可迁移性上均有显著提升,一致地实现了均方根偏差平均降低 25–30%、R2 分数平均提高 40–50%。我们方法的一个关键优势是可解释性:我们的模型识别出了在不同压力下与吸附最相关的孔,这有助于理解材料设计中的原子级结构—性能关系。

关键词

引用

@article{arxiv.2010.00532,
  title  = {Machine learning with persistent homology and chemical word embeddings improves prediction accuracy and interpretability in metal-organic frameworks},
  author = {Aditi S. Krishnapriyan and Joseph Montoya and Maciej Haranczyk and Jens Hummelshøj and Dmitriy Morozov},
  journal= {arXiv preprint arXiv:2010.00532},
  year   = {2021}
}

备注

14 pages main text, 8 figures