中文

基于高斯过程的多保真度分类:加速大规模计算模型的预测

机器学习 2019-10-02 v1 机器学习

摘要

机器学习技术通常依赖大型数据集以构建准确的分类器。然而,在某些情形下数据稀缺且获取成本高昂。对于依赖最先进计算模型的研究便是如此,这类模型通常需运行数日,从而阻碍了机器学习工具的潜力。本工作中,我们提出一种新颖分类器,其利用低保真度模型与廉价近似来预测昂贵计算机模拟的二值输出。我们在不同保真度层级间以高斯过程先验假设了一个自回归模型。我们对超参数采用完全贝叶斯处理并使用马尔可夫链蒙特卡洛采样器。我们利用分类器的概率性质来实现主动学习策略。我们还引入了稀疏近似以增强多保真度分类器处理大型数据集的能力。我们利用合成数据将这些多保真度分类器与其单保真度对应物进行测试,在 90% 目标精度下显示出中位数计算成本降低 23%。在心脏电生理学中,当二者均用 50 个样本训练时,多保真度分类器达到了 99.6% 的 F1 分数(精确率与召回率的调和平均),而单保真度分类器仅为 74.1%。总体而言,我们的结果表明多保真度分类器在准确性方面于所有案例中均优于其单保真度对应物。我们预期这一新工具将使研究者能够研究原本成本高昂得难以承受的分类问题。源代码见 https://github.com/fsahli/MFclass。

关键词

引用

@article{arxiv.1905.03406,
  title  = {Multi-fidelity classification using Gaussian processes: accelerating the prediction of large-scale computational models},
  author = {Francisco Sahli Costabal and Paris Perdikaris and Ellen Kuhl and Daniel E. Hurtado},
  journal= {arXiv preprint arXiv:1905.03406},
  year   = {2019}
}