中文

构建多保真度代理模型时有害数据源的特征刻画

统计方法学 2024-03-14 v1 人工智能 机器学习 机器学习

摘要

代理建模技术在近年来应用于工业设计问题的建模与优化时受到越来越多的关注。当评估特定设计的性能成本高昂时,这些技术尤为重要,因为可以通过构建一个模型来替代可用的高成本源进行查询,从而降低总体成本。这些模型的构建有时会利用其他更便宜但精度较低的信息源。然而,这些源的存在提出了在构建模型时应使用哪些源的问题。最近的研究试图刻画有害数据源的特征,以指导实践者选择何时忽略某个源。这些研究是在合成环境中进行的,使用了实践中无法获得的大量数据来刻画源的特征。其中一些研究还被证明在分析所用的基准中可能存在偏差。在本研究中,我们仅使用训练代理模型时可用的有限数据,提出了有害低保真度源的特征刻画。我们采用最近开发的基准过滤技术进行无偏评估,为未来研究提供了客观且多样化的不同规模基准套件。利用实例空间分析技术分析其中一个基准套件,我们直观地展示了何时应使用低保真度源,并利用该分析提供了可应用于工业环境的指导方针。

关键词

引用

@article{arxiv.2403.08118,
  title  = {Characterising harmful data sources when constructing multi-fidelity surrogate models},
  author = {Nicolau Andrés-Thió and Mario Andrés Muñoz and Kate Smith-Miles},
  journal= {arXiv preprint arXiv:2403.08118},
  year   = {2024}
}