中文

ChemPile:用于化学基础模型的250GB多样且精选数据集

机器学习 2025-05-20 v1

摘要

基础模型在科学领域展现出惊人的成功,但在化学领域的影响力仍受限于缺乏能反映该领域多面性的多样化、大规模、高质量数据集。我们提出ChemPile,一个包含超过750亿token的开放化学数据集,专为训练和评估化学科学通用模型而构建。该数据集镜像了人类学习化学的过程——从教育基础到专业专长,涵盖多种模态和内容类型,包括结构化数据(多种化学表示形式,如SMILES、SELFIES、IUPAC名称、InChI、分子渲染)、科学和教育文本、可执行代码和化学图像。ChemPile整合了基础知识(教科书、 lecture notes)、专业专长(科学论文和语言交互数据)、视觉理解(分子结构、图表)和高级推理(问题解决痕迹和代码),镜像人类化学家通过多样化学习材料和经历逐步发展专业知识的过程。通过数百小时的专家筛选,ChemPile捕捉了基础概念和领域特定复杂性。我们提供标准化的训练、验证和测试划分,实现稳健的基准测试。ChemPile通过HuggingFace开放发布,配备一致的API、宽松许可证和详细文档。我们期望ChemPile将为化学AI提供催化剂,推动下一代化学基础模型的发展。

关键词

引用

@article{arxiv.2505.12534,
  title  = {ChemPile: A 250GB Diverse and Curated Dataset for Chemical Foundation Models},
  author = {Adrian Mirza and Nawaf Alampara and Martiño Ríos-García and Mohamed Abdelalim and Jack Butler and Bethany Connolly and Tunca Dogan and Marianna Nezhurina and Bünyamin Şen and Santosh Tirunagari and Mark Worrall and Adamo Young and Philippe Schwaller and Michael Pieler and Kevin Maik Jablonka},
  journal= {arXiv preprint arXiv:2505.12534},
  year   = {2025}
}