中文

利用PySCF$_{\text{IPU}}$生成QM1B数据集

机器学习 2023-11-03 v1 化学物理

摘要

计算机视觉和自然语言处理中基础模型的出现,极大推动了下游任务的进展。这一进展得益于拥有数十亿训练样本的数据集。量子化学领域尚未释放类似收益,其中深度学习的潜力受限于规模相对较小的、含10万至2000万训练样本的数据集。这些数据集规模受限,因为其标签由密度泛函理论(DFT)的精确(但计算昂贵)预测计算所得。值得注意的是,先前的DFT数据集是使用CPU超级计算机创建,未利用硬件加速。在本文中,我们通过引入使用智能处理单元(IPU)的数据生成器PySCFIPU_{\text{IPU}},向利用硬件加速器迈出第一步。这使我们创建了含十亿训练样本、包含9-11个重原子的QM1B数据集。我们展示一个简单的基线神经网络(SchNet 9M)仅通过增加训练数据量、无需额外归纳偏置即提升了性能。为鼓励未来研究者负责任地使用QM1B,我们强调了QM1B的若干局限,并指出我们DFT选项的低分辨率,这也成为构建更大型、更精确数据集的动力。代码与数据集可在Github获取:http://github.com/graphcore-research/pyscf-ipu

关键词

引用

@article{arxiv.2311.01135,
  title  = {Generating QM1B with PySCF$_{\text{IPU}}$},
  author = {Alexander Mathiasen and Hatem Helal and Kerstin Klaser and Paul Balanca and Josef Dean and Carlo Luschi and Dominique Beaini and Andrew Fitzgibbon and Dominic Masters},
  journal= {arXiv preprint arXiv:2311.01135},
  year   = {2023}
}

备注

15 pages, 7 figures. NeurIPS 2023 Track Datasets and Benchmarks