天然产物化学语言模型:基于状态空间模型的方法
机器学习
2026-02-17 v1 人工智能
摘要
语言模型在化学领域广泛用于分子性质预测和小分子生成,但天然产物(Natural Products, NP)由于其在药物发现中的重要性,仍未得到充分探索。为此,我们开发了针对天然产物的专用化学语言模型(Natural Product Chemical Language Models, NPCLMs),通过对状态空间模型(Mamba 和 Mamba-2)进行预训练,并与变换器基线(GPT)进行比较。我们使用约100万分子的天然产物数据集,首次系统性比较了选择性状态空间模型和变换器在针对天然产物任务中的表现,并介绍了八种分词策略,包括字符级、原子-SMILES(Atom-in-SMILES, AIS)、字节对编码(BPE)以及针对天然产物的专用 BPE。我们评估了分子生成(有效性、唯一性、新颖性)和性质预测(膜通透性、味觉、抗癌活性),使用 MCC 和 AUC-ROC 进行评估。Mamba 比 Mamba-2 和 GPT 生成的分子在有效性和唯一性方面多出1%-2%,并产生更少的长程依赖错误,而 GPT 则略高出更多新颖结构。对于性质预测,Mamba 变体在随机划分下比 GPT 在 MCC 上高出0.02-0.04,而在骨架划分下表现相当。结果表明,对约100万分子的天然产物进行领域特定预训练即可匹配在数据集规模是其100倍以上的模型训练所得结果。
引用
@article{arxiv.2602.13958,
title = {Chemical Language Models for Natural Products: A State-Space Model Approach},
author = {Ho-Hsuan Wang and Afnan Sultan and Andrea Volkamer and Dietrich Klakow},
journal= {arXiv preprint arXiv:2602.13958},
year = {2026}
}