中文

M$^{3}$-20M:面向 AI 驱动的药物设计与发现的大规模多模态分子数据集

定量方法 2025-03-18 v2 人工智能 机器学习

摘要

本文介绍了 M3^{3}-20M,一个大规模多模态分子数据集,包含超过 2000 万个分子,数据主要来自现有数据库的整合,部分由大语言模型生成。该数据集旨在支持 AI 驱动的药物设计与发现,其分子数量是现有最大数据集的 71 倍,提供了前所未有的规模,可极大受益于模型的训练或微调,包括用于药物设计与发现任务的大语言模型。该数据集整合了一维 SMILES、二维分子图、三维分子结构、物理化学性质以及通过网络爬取收集并使用 GPT-3.5 生成的文本描述,为每个分子提供了全面的视角。为展示 M3^{3}-20M 在药物设计与发现中的能力,我们在两个关键任务上进行了广泛实验:分子生成和分子性质预测,使用的大语言模型包括 GLM4、GPT-3.5、GPT-4 和 Llama3-8b。实验结果表明,M3^{3}-20M 可以显著提升模型在两个任务上的性能。具体而言,它使模型能够生成更多样化且有效的分子结构,并比现有单模态数据集实现更高的性质预测准确率,验证了 M3^{3}-20M 在支持 AI 驱动的药物设计与发现中的价值和潜力。该数据集可在 https://github.com/bz99bz/M-3 获取。

关键词

引用

@article{arxiv.2412.06847,
  title  = {M$^{3}$-20M: A Large-Scale Multi-Modal Molecule Dataset for AI-driven Drug Design and Discovery},
  author = {Siyuan Guo and Lexuan Wang and Chang Jin and Jinxian Wang and Han Peng and Huayang Shi and Wengen Li and Jihong Guan and Shuigeng Zhou},
  journal= {arXiv preprint arXiv:2412.06847},
  year   = {2025}
}