中文

NovoMolGen:重新思考分子语言模型预训练

机器学习 2025-08-25 v2

摘要

设计新颖的分子以实现所需的属性配置需要高效地探索从 102310^{23}106010^{60} 个可合成候选者的广阔化学空间。虽然已developed various 深度生成模型来设计小分子,使用多样化的输入表示,但基于字符串表示的分子大型语言模型 (Mol-LLM) 已成为能够探索数十亿分子的可扩展方法。然而,仍缺乏对标准语言建模实践(如文本表示、分词策略、模型规模和数据规模)如何影响分子生成性能的理解。本文通过引入 NovoMolGen,一套在 15 亿分子上进行预训练的基于Transformer的 foundation 模型,系统性地调查了这些关键方面。通过大量经验分析,我们发现预训练期间衡量的性能指标与实际下游性能之间存在弱相关,这揭示了分子与通用 NLP 训练动力学之间的重要区别。NovoMolGen 在无约束和以目标为导向的分子生成任务中均显著优于先前的 Mol-LLM 和专用生成模型,为推动高效和有效的分子建模策略提供了稳健的基础。

关键词

引用

@article{arxiv.2508.13408,
  title  = {NovoMolGen: Rethinking Molecular Language Model Pretraining},
  author = {Kamran Chitsaz and Roshan Balaji and Quentin Fournier and Nirav Pravinbhai Bhatt and Sarath Chandar},
  journal= {arXiv preprint arXiv:2508.13408},
  year   = {2025}
}