面向主动资源型试验的置信度调整惊喜度量(CA-SMART):一种在资源约束下加速材料发现的数据驱动主动学习框架
机器学习
2025-03-28 v1 人工智能
应用统计
摘要
由于搜索空间巨大、实验成本高昂以及材料表征耗时,加速具有特定性能的先进材料的发现和制造是一项关键而艰巨的挑战。近年来,主动学习作为一种有前景的方法应运而生,其中代理机器学习(ML)模型模拟人类科学家的科学发现过程,通过引导实验朝向高价值结果,在有限预算下应对这些挑战。在多种主动学习理念中,惊喜度的概念(捕捉预期结果与观测结果之间的差异)已显示出推动推动实验试验和优化预测模型的显著潜力。科学发现往往源于惊喜,因此它自然成为引导搜索过程的驱动力。尽管具有前景,但先前利用 Shannon 和 Bayesian 惊喜度等指标的研究缺乏对先验置信度的考量机制,导致对不确定区域的过度探索,而这些区域未必能提供有用信息。为解决这一问题,我们提出了面向主动资源型试验的置信度调整惊喜度量(CA-SMART),这是一种专为优化数据驱动实验而设计的新型 Bayesian 主动学习框架。总体而言,CA-SMART 引入置信度调整惊喜度(CAS),通过在模型较为确定的区域放大惊喜度、在高度不确定区域降低惊喜度,来动态平衡探索与利用。我们在两个基准函数(Six-Hump Camelback 和 Griewank)以及钢材疲劳强度预测任务上评估了 CA-SMART。结果表明,与传统惊喜度指标、标准 Bayesian Optimization (BO) 采集函数以及常规 ML 方法相比,CA-SMART 具有更高的准确性和效率。
引用
@article{arxiv.2503.21095,
title = {Confidence Adjusted Surprise Measure for Active Resourceful Trials (CA-SMART): A Data-driven Active Learning Framework for Accelerating Material Discovery under Resource Constraints},
author = {Ahmed Shoyeb Raihan and Zhichao Liu and Tanveer Hossain Bhuiyan and Imtiaz Ahmed},
journal= {arXiv preprint arXiv:2503.21095},
year = {2025}
}