用于从任意数量多保真度数据集学习的概率神经数据融合
机器学习
2023-07-26 v1 机器学习
摘要
在科学与工程诸多应用中,分析人员可同时访问多个数据源。此类情形下,可通过数据融合或多保真度(MF)建模降低信息获取的总体成本,即利用廉价的低保真度(LF)源减少对昂贵高保真度(HF)数据的依赖。本文中,我们在数据极为稀缺且来源于任意数量、保真度与成本各异的源时,采用神经网络(NNs)进行数据融合。我们引入一种独特的 NN 架构,将 MF 建模转化为非线性流形学习问题。我们的 NN 架构在一个可解释且可视化的流形中逆向学习 LF 源的非平凡(如非加性与非层次性)偏差,其中每个数据源通过低维分布编码。该概率流形量化了模型形式不确定性,使得偏差小的 LF 源被编码在靠近 HF 源处。此外,我们赋予 NN 输出参数化分布,不仅量化偶然不确定性,还基于严格恰当评分规则重构网络损失函数,从而提升对未知 HF 数据的鲁棒性与精度。通过一组解析与工程实例,我们证明该方法在量化各类源不确定性的同时具备高预测能力。
引用
@article{arxiv.2301.13271,
title = {Probabilistic Neural Data Fusion for Learning from an Arbitrary Number of Multi-fidelity Data Sets},
author = {Carlos Mora and Jonathan Tammer Eweis-Labolle and Tyler Johnson and Likith Gadde and Ramin Bostanabad},
journal= {arXiv preprint arXiv:2301.13271},
year = {2023}
}