用于分子性质预测的Transformer:领域自适应高效提升性能
机器学习
2025-05-23 v3 人工智能
计算与语言
摘要
在过去六年中,分子Transformer模型已成为药物发现的关键工具。大多数现有模型都在ZINC或ChEMBL等大型无标签数据集上进行预训练。然而,大规模预训练在多大程度上改善分子性质预测仍不清楚。本研究在解决其局限性的同时评估了用于此任务的Transformer模型。我们探讨了预训练数据集大小和化学信息导向的目标如何影响性能。结果表明,将数据集从大规模无标签数据库增加至约40万到80万分子,并不会提升涵盖五个ADME终点(亲脂性、通透性、溶解度两个数据集、微粒体稳定性两个数据集和血浆蛋白结合)的七个数据集上的性能。相比之下,在小型领域特定数据集(≤4K分子)上使用物理化学性质的多任务回归进行领域自适应,显著提升了性能(P值小于0.001)。在40万分子上预训练并使用领域特定数据进行自适应的模型,优于MolFormer等更大的模型,并且性能与MolBERT相当。与使用描述符和Morgan指纹的随机森林(RF)基线进行基准对比表明,化学和物理信息导向的特征在各类模型中始终产生更好的性能。虽然RF仍然是一个强有力的基线,但我们识别出了提升Transformer性能的具体方法。将预训练和自适应与化学意义明确的任务和领域相关数据对齐,是分子性质预测的一个有前景的方向。我们的模型已在HuggingFace上发布,便于使用和自适应。
引用
@article{arxiv.2503.03360,
title = {Transformers for molecular property prediction: Domain adaptation efficiently improves performance},
author = {Afnan Sultan and Max Rausch-Dupont and Shahrukh Khan and Olga Kalinina and Dietrich Klakow and Andrea Volkamer},
journal= {arXiv preprint arXiv:2503.03360},
year = {2025}
}