中文

Open Catalyst 2020 (OC20) 数据集与社区挑战

材料科学 2021-09-27 v5 机器学习

摘要

催化剂的发现与优化是解决诸多社会与能源挑战(包括太阳能燃料合成、长期能量存储和可再生肥料生产)的关键。尽管催化界为将机器学习模型应用于计算催化剂发现过程付出了可观努力,构建能够跨表面元素组成与吸附物身份/构型泛化的模型仍是一项开放挑战,或许因为催化领域的数据集比相关领域更小。为此我们开发了 OC20 数据集,包含 1,281,040 次密度泛函理论(DFT)弛豫(约 264,890,000 次单点计算),覆盖广泛的材料、表面与吸附物(氮、碳和氧化学)。我们以随机扰动结构、短时间尺度分子动力学和电子结构分析补充了该数据集。该数据集包含三项指示日常催化剂建模的核心任务,并配有预定义的训练/验证/测试划分以促进未来模型开发工作的直接比较。我们将三种最先进的图神经网络模型(CGCNN、SchNet、Dimenet++)应用于每项任务,作为供社区构建的基线演示。在几乎每项任务中,均未发现模型大小的上限,表明更大的模型有可能在初始结果上进一步提升。该数据集与基线模型均作为开放资源提供,并设有公共排行榜以鼓励社区贡献来解决这些重要任务。

关键词

引用

@article{arxiv.2010.09990,
  title  = {The Open Catalyst 2020 (OC20) Dataset and Community Challenges},
  author = {Lowik Chanussot and Abhishek Das and Siddharth Goyal and Thibaut Lavril and Muhammed Shuaibi and Morgane Riviere and Kevin Tran and Javier Heras-Domingo and Caleb Ho and Weihua Hu and Aini Palizhati and Anuroop Sriram and Brandon Wood and Junwoong Yoon and Devi Parikh and C. Lawrence Zitnick and Zachary Ulissi},
  journal= {arXiv preprint arXiv:2010.09990},
  year   = {2021}
}

备注

37 pages, 11 figures, submitted to ACS Catalysis