当主动学习失败时,未校准的外分布不确定性量化可能是问题
材料科学
2025-11-25 v1 机器学习
摘要
高效且有意义地估计预测不确定性对于材料发现中的主动学习探索至关重要,在这种情况下,具有高不确定性的样本被解释为包含模型缺失的相关信息。本文评估了不同不确定性估计和校准方法在使用ALIGNN、eXtreme Gradient Boost、Random Forest和Neural Network模型架构进行主动学习时的效果。我们将ALIGNN深度集成的不确定性估计与solubility、bandgap和formation energy预测任务中获得的损失景观不确定性估计进行比较。随后,我们评估了不确定性估计质量对寻求模型对外分布数据泛化的主动学习活动的影响。发现不确定性校准方法在从领域内数据泛化到领域外数据方面效果各异。此外,与随机抽样和未校准的不确定性相比,校准后的不确定性通常在外分布数据上未能减少模型在主动学习活动中所需的数据量。来自随机森林和eXtreme Gradient Boosting模型在相同数据和相同任务上训练的模型表明,这至少部分是数据固有的,而非仅由模型容量导致。分析目标、分布内不确定性、分布外不确定性和训练残差分布表明,未来工作应聚焦于理解在ensemble预测方差未能准确捕获模型泛化所需缺失信息的情况下,特征输入空间中的经验不确定性。
引用
@article{arxiv.2511.17760,
title = {When Active Learning Fails, Uncalibrated Out of Distribution Uncertainty Quantification Might Be the Problem},
author = {Ashley S. Dale and Kangming Li and Brian DeCost and Hao Wan and Yuchen Han and Yao Fehlis and Jason Hattrick-Simpers},
journal= {arXiv preprint arXiv:2511.17760},
year = {2025}
}