SynCoTrain:一种用于可合成性预测的双分类器 PU 学习框架
材料科学
2024-11-20 v1 机器学习
摘要
材料发现是现代科学的基石,推动着从生物医学技术到气候解决方案等众多学科的进步。预测可合成性是实现新材料的关键因素,但由于传统启发式方法和热力学代理指标的局限性,这仍然是一个复杂的挑战。虽然形成能等稳定性指标提供了部分洞察,但它们未能解释影响合成结果的动力学因素和技术约束。由于失败的合成尝试通常未发表或具有特定背景,负数据的稀缺进一步加剧了这些挑战。我们提出了 SynCoTrain,一种旨在预测材料可合成性的半监督机器学习模型。SynCoTrain 采用协同训练框架,利用两个互补的图卷积神经网络:SchNet 和 ALIGNN。通过在分类器之间迭代交换预测结果,SynCoTrain 减轻了模型偏差并增强了泛化能力。我们的方法使用正未标记(PU)学习来解决显式负数据的缺失问题,通过协同学习迭代地优化预测。该模型表现出稳健的性能,在内部测试集和留出测试集上均实现了高召回率。通过聚焦于氧化物晶体这一具有丰富实验数据且表征良好的材料家族,我们在平衡数据集变异性和计算效率的同时,确立了 SynCoTrain 作为预测可合成性的可靠工具。这项工作凸显了协同训练在推进高通量材料发现和生成式研究方面的潜力,为可合成性预测挑战提供了可扩展的解决方案。
引用
@article{arxiv.2411.12011,
title = {SynCoTrain: A Dual Classifier PU-learning Framework for Synthesizability Prediction},
author = {Sasan Amariamir and Janine George and Philipp Benner},
journal= {arXiv preprint arXiv:2411.12011},
year = {2024}
}