MolPILE——大规模、多样化的分子表示学习数据集
机器学习
2025-09-26 v2
摘要
预训练数据集的规模、多样性和质量至关决定了基础模型的泛化能力。尽管其在化学信息学中的重要性日益突出,但现有小分子数据集的局限性仍限制了分子表示学习的有效性。为填补这一空白,本文提出了 MolPILE,一个由 2200 万化合物组成的大规模、多样化且经过严格筛选的集合,由 6 个大型数据库通过自动化筛选流程构建而成。我们对当前的预训练数据集进行了全面分析,指出其在训练机器学习模型时存在显著不足之处,并演示了在 MolPILE 上重新训练现有模型可提升泛化性能。本工作为模型训练提供了标准化资源,解决了在分子化学中亟需的类似 ImageNet 数据集的问题。
引用
@article{arxiv.2509.18353,
title = {MolPILE -- large-scale, diverse dataset for molecular representation learning},
author = {Jakub Adamczyk and Jakub Poziemski and Franciszek Job and Mateusz Król and Maciej Makowski},
journal= {arXiv preprint arXiv:2509.18353},
year = {2025}
}