MD-HIT:通过数据集冗余控制进行材料属性预测的机器学习方法
材料科学
2023-07-11 v1 机器学习
摘要
由于材料研究史上修修补补式的材料设计实践,材料数据集通常以存在许多冗余(高度相似)材料为特征。例如,Materials Project 数据库中有许多类似于 SrTiO 的钙钛矿立方结构材料。数据集内的这种样本冗余使得机器学习模型评估的随机划分失效,导致 ML 模型往往取得被高估的预测性能,这对材料科学界具有误导性。该问题在生物信息学蛋白质功能预测领域已广为人知,其中总是应用冗余降低流程(CD-Hit)来减少样本冗余,确保任意样本对的序列相似度不超过给定阈值。本文调研了文献中基于成分和基于结构的材料属性预测里被高估的 ML 性能。随后我们提出一种称为 MD-HIT 的材料数据集冗余降低算法,并使用若干基于成分和结构的距离阈值来评估其降低数据集样本冗余的效果。我们表明,经此控制后,预测性能往往能更好地反映其真实预测能力。我们的 MD-HIT 代码可在 https://github.com/usccolumbia/MD-HIT 免费获取。
引用
@article{arxiv.2307.04351,
title = {MD-HIT: Machine learning for materials property prediction with dataset redundancy control},
author = {Qin Li and Nihang Fu and Sadman Sadeed Omee and Jianjun Hu},
journal= {arXiv preprint arXiv:2307.04351},
year = {2023}
}
备注
12pages