预训练分子性质预测中的数据不平衡问题
机器学习
2023-08-21 v1 材料科学
摘要
揭示并分析材料的各种性质是材料发展(包括电池、半导体、催化剂和药物)中基本且关键的问题。传统上,这些性质通过理论计算与模拟确定。然而,对每一种候选材料都进行此类计算并不现实。近来,出现了理论计算与机器学习相结合的方法,即在理论计算结果的子集上训练机器学习模型,构建可应用于其余材料的代理模型。另一方面,一种称为预训练的技术被用于提高机器学习模型的精度。预训练指在模型于目标任务上训练之前,先在一个不同于目标任务的 pretext task 上训练模型。该过程旨在提取输入数据特征,稳定学习过程并提高其精度。然而,在分子性质预测中,输入数据与特征的分布存在严重不平衡,可能导致预训练过程中学习偏向频繁出现的数据。本研究提出一种解决输入数据不平衡的有效预训练方法。我们旨在通过修改现有代表性预训练方法(节点掩码)的损失函数以补偿不平衡,从而提升最终精度。我们通过分子性质预测模型的基准测试实验与评估,研究并考察了所提不平衡补偿对预训练及最终预测精度的影响。
引用
@article{arxiv.2308.08934,
title = {On Data Imbalance in Molecular Property Prediction with Pre-training},
author = {Limin Wang and Masatoshi Hanai and Toyotaro Suzumura and Shun Takashige and Kenjiro Taura},
journal= {arXiv preprint arXiv:2308.08934},
year = {2023}
}