巨大的胆识:克服计算材料发现中机器学习面临的数据稀缺与数据质量挑战
化学物理
2021-11-04 v1 材料科学
机器学习
摘要
机器学习 (ML) 加速的发现需要大量高保真数据来揭示预测性的构效关系。对于材料发现中许多令人感兴趣的性质,数据生成的挑战性和高成本导致了数据图景既稀疏又质量可疑。开始克服这些限制的数据驱动技术包括:在密度泛函理论中使用不同泛函间的共识、开发新泛函或加速电子结构理论,以及检测最需要计算成本高昂方法之处。当性质无法可靠模拟时,可使用大型实验数据集来训练 ML 模型。在缺乏人工整理的情况下,日益复杂的自然语言处理和自动图像分析使得从文献中学习构效关系成为可能。在这些数据集上训练的模型将随着纳入社区反馈而不断改进。
引用
@article{arxiv.2111.01905,
title = {Audacity of huge: overcoming challenges of data scarcity and data quality for machine learning in computational materials discovery},
author = {Aditya Nandy and Chenru Duan and Heather J. Kulik},
journal= {arXiv preprint arXiv:2111.01905},
year = {2021}
}