中文

预训练数据对齐对原子性质预测的重要性

机器学习 2026-02-03 v2 人工智能

摘要

本文挑战了原子性质预测领域近期将进展与数据集规模和计算资源增长联系起来的范式。我们表明,在精心选择的任务对齐数据集上进行预训练,可以匹配甚至超越大规模联合预训练,同时仅使用 1/24 的预训练预算。我们引入了化学相似性指数(CSI),这是一种受计算机视觉中 Fréchet Inception Distance 启发的分子图简单度量,用于量化上游预训练数据集与下游任务之间的对齐程度。通过选择具有最小 CSI 距离的最对齐数据集,我们表明,在较小、聚焦的数据集上预训练的模型在下游任务上的表现始终优于在 JMP 等大规模混合数据集上预训练的模型。即使混合数据集包含与下游任务最对齐的上游数据集,情况也是如此。与直觉相反,我们还发现,当额外数据与目标任务对齐不佳时,不加选择地添加更多数据会降低模型性能。我们的发现强调,在原子性质预测的预训练中,质量往往胜过数量。

关键词

引用

@article{arxiv.2502.11085,
  title  = {On the Importance of Pretraining Data Alignment for Atomic Property Prediction},
  author = {Yasir Ghunaim and Hasan Abed Al Kader Hammoud and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2502.11085},
  year   = {2026}
}

备注

Published in Transactions on Machine Learning Research (TMLR), 2026