中文

性质指定化学特征空间中最远点抽样:提高小规模化学数据集机器学习模型性能的通用策略

化学物理 2026-05-19 v1 数据分析、统计与概率

摘要

化学和材料科学中的机器学习模型开发常面临小规模、不平衡标记数据集的挑战,这是科学实验常见的局限。这些数据不平衡会导致过拟合并降低模型的泛化能力。我们探讨了在目标化学特征空间中应用最远点抽样(FPS)策略的有效性,展示了其生成均匀训练数据集并随之提升模型性能的能力。我们严格评估了该策略在各种机器学习模型中的表现,包括人工神经网络(ANN)、支持向量机(SVM)和随机森林(RF),使用包含标准沸点和蒸发焓等物性物理化学性质的数据集。我们的发现表明,基于FPS的模型始终优于随机抽样训练的模型,表现出更好的预测准确性和鲁棒性,同时显著减少了过拟合。这种改进在较小的训练数据集中尤为显著,归因于训练数据在化学特征空间中的更高多样性。因此,FPS作为一种普遍有效且可适应的方法,能够在化学和材料科学中常见的小规模和偏差实验数据集下,实现高性能机器学习模型。

关键词

引用

@article{arxiv.2404.11348,
  title  = {Farthest Point Sampling in Property Designated Chemical Feature Space as a General Strategy for Enhancing the Machine Learning Model Performance for Small Scale Chemical Dataset},
  author = {Yuze Liu and Xi Yu},
  journal= {arXiv preprint arXiv:2404.11348},
  year   = {2026}
}

备注

9 pages, 5 figures