在材料信息学中将深度信息最大化确立为有效的自监督学习方法
机器学习
2024-07-02 v1 材料科学
摘要
属性标签的稀缺性仍是材料信息学中的关键挑战,而相对于大量无属性标签的材料数据则丰富得多。通过在仅依赖于任何晶体信息文件(CIF)中可用“内在信息”的自监督任务上预训练受监督的属性预测模型,即可利用大量无属性标签的晶体数据,以提高小数据集上的属性预测结果。我们将深度信息最大化(Deep InfoMax)应用于材料信息学的自监督机器学习框架,以显式最大化晶体点集(或图)表示与适用于下游学习的向量表示之间的互信息。这允许在无需属性标签的情况下,对大规模材料数据集进行预训练,而无需使模型从表示向量重建晶体。我们探讨了在 Site-Net 架构上实现的深度信息最大化预训练,以提高下游属性预测模型在少量(<10^3)数据情况下的性能,这种情况适用于实验测量的材料属性数据库。我们采用属性标签遮蔽方法,即在较大的受监督数据集上进行自监督学习,然后在标签子集上训练受监督模型,以隔离深度信息最大化预训练的影响。我们在带隙和形成能预测任务中分别展示了在表征学习和迁移学习情境下的性能提升。虽然在受控环境中确立了深度信息最大化预训练的有效性,但我们的发现为将该方法扩展以解决材料信息学中的实际挑战奠定了基础。
引用
@article{arxiv.2407.00671,
title = {Establishing Deep InfoMax as an effective self-supervised learning methodology in materials informatics},
author = {Michael Moran and Vladimir V. Gusev and Michael W. Gaultois and Dmytro Antypov and Matthew J. Rosseinsky},
journal= {arXiv preprint arXiv:2407.00671},
year = {2024}
}