揭示分子语言模型中的比例规律:模型规模、数据与表征的影响
机器学习
2026-02-02 v1 生物大分子
摘要
分子生成模型通常采用基于分子字符串表示的 GPT 风格语言建模方法,在大规模数据集和模型规模下展现出良好的能力。然而,这些模型在固定计算预算下是否遵循可预测的比例规律仍不明确且存在争议,这对于在模型规模、数据量和分子表征之间合理分配资源具有关键意义。本研究系统性地探讨了分子语言模型在预训练和下游任务中的比例行为。我们训练了 300 个模型,进行了超过 1 万次实验,严格控制计算预算,独立变更模型规模、训练标记数和分子表征。我们的结果表明,分子模型在预训练和下游迁移学习中都存在清晰的比例规律,揭示了分子表征对性能的显著影响,并解释了之前观察到的分子生成比例行为不一致的原因。此外,我们公开了目前为止最大规模的分子语言模型库,以促进未来的研究与开发。代码和模型均可在 https://github.com/SZU-ADDG/MLM-Scaling 获取。
引用
@article{arxiv.2601.22757,
title = {Unveiling Scaling Behaviors in Molecular Language Models: Effects of Model Size, Data, and Representation},
author = {Dong Xu and Qihua Pan and Sisi Yuan and Jianqiang Li and Zexuan Zhu and Junkai Ji},
journal= {arXiv preprint arXiv:2601.22757},
year = {2026}
}
备注
34 pages, 51 figures