中文

基于表格基础模型的分子属性原地预测

机器学习 2026-04-21 v2 化学物理

摘要

精确的分子属性预测是药物发现、催化和工艺设计中的核心问题,但实际应用常受限于小规模数据集。分子基础模型通过学习可迁移的分子表征提供了可行的解决方案;然而,这些模型通常涉及任务特定的微调,需要机器学习专业知识,并且常常未能优于经典基线方法。表格基础模型(TFMs)提供了 fundamentally different 的方法:它们通过原地学习进行预测,实现无需任务特定训练的推理。本文在标准化的制药基准测试和化学工程数据集上评估了TFMs在低至中等数据规模下的表现。我们评估了冻结的分子基础模型表征以及经典描述符和指纹。跨越所有基准测试,该方法在降低计算成本方面优于微调方法,同时展现出优异的预测性能,这些优势也能延续至实际工程数据场景。在特定情况下,结合TFMs与CheMeleon嵌入可实现对30个MoleculeACE任务达到100%的优势率,而紧凑型的RDKit2d和Mordred描述符则提供了强大的描述符替代方案。分子表征在TFMs性能中起到关键作用,分子基础模型嵌入和2D描述符集合在许多任务上均显著优于经典分子指纹。这些结果表明,TFMs的原地学习为实际应用中的属性预测提供了一种高精度且成本效益极佳的替代方案。

关键词

引用

@article{arxiv.2604.16123,
  title  = {Tabular foundation models for in-context prediction of molecular properties},
  author = {Karim K. Ben Hicham and Jan G. Rittig and Martin Grohe and Alexander Mitsos},
  journal= {arXiv preprint arXiv:2604.16123},
  year   = {2026}
}