中文

数据偏差对晶体化合物可合成性预测机器学习的影响

材料科学 2024-12-11 v1

摘要

机器学习模型容易因训练数据中的偏差而产生误导,这些偏差会强调偶然的相关性而非预期的学习任务。在本研究中,我们展示了数据偏差对旨在预测晶体化合物可合成性可能性的机器学习模型性能的影响。该模型对标记的晶体样本进行二元分类。尽管使用了相同的机器学习模型架构,我们展示了模型的学习和预测行为在基于不同数据集训练后如何发生变化。我们使用两个数据集进行说明:一个整合了实验和计算晶体样本的混合源数据集,以及一个仅包含来自一个计算数据库的数据的单源数据集。我们提出了检测数据偏差并评估其对模型性能和泛化能力影响的简单程序。这项研究揭示了不一致、不平衡的数据如何传播偏差,即使是先进的机器学习技术,也会削弱其现实世界的适用性。

关键词

引用

@article{arxiv.2406.17956,
  title  = {Impact of Data Bias on Machine Learning for Crystal Compound Synthesizability Predictions},
  author = {Ali Davariashtiyani and Busheng Wang and Samad Hajinazar and Eva Zurek and Sara Kadkhodaei},
  journal= {arXiv preprint arXiv:2406.17956},
  year   = {2024}
}

备注

8 pages, 4 figures, 3 appendices