面向机器学习钙钛矿合金的高效数据集生成
材料科学
2025-06-09 v1 计算物理
摘要
铅基钙钛矿太阳能电池已实现高效能,但因毒性和缺乏稳定性而阻碍其大规模应用。这一问题通过钙钛矿材料的组成工程部分缓解,但钙钛矿材料空间的巨大复杂性构成了探索的重大障碍。我们此前已演示如何加速 CsPb(Cl/Br) 钙钛矿合金的属性预测。然而,密度泛函理论 (DFT) 计算在模型训练中所需的计算资源浪费,阻碍了对更复杂材料的应用。本文引入一种数据高效方案以促进模型训练,最初在 CsPb(Cl/Br) 数据上进行验证,并扩展至三元合金 CsSn(Cl/Br/I)。我们的方法采用聚类构建紧凑且多样的初始原子结构数据集,然后应用两阶段主动学习法,首先改善基于机器学习的结构松弛可靠性,再在平衡结构附近精炼准确性。针对 CsPb(Cl/Br) 的测试表明,我们的方法在不同阶段的模型训练中将所需 DFT 计算数量分别降低最高可达 20% 和 50%。针对 CsSn(Cl/Br/I) 的拟合模型表现稳健且高度准确,所有基于机器学习的结构松弛均收敛,平均松弛误差仅为 0.5 meV/atom。
引用
@article{arxiv.2506.05777,
title = {Efficient dataset generation for machine learning perovskite alloys},
author = {Henrietta Homm and Jarno Laakso and Patrick Rinke},
journal= {arXiv preprint arXiv:2506.05777},
year = {2025}
}
备注
Main text 11 pages, 7 figures, with supplementary material 6 pages, 5 figures