中文

基于连分数外推学习:预测超导材料的临界温度

机器学习 2023-08-14 v3 超导电性 人工智能 神经与进化计算

摘要

在人工智能(AI)与机器学习(ML)领域,利用有限样本 S=(x(i),y(i))S={(\mathbf{x^{(i)}},y^{(i)})}(其中 x(i)D\mathbf{x^{(i)}} \in DDD 表示感兴趣的定义域)逼近未知目标函数 y=f(x)y=f(\mathbf{x}) 是一个常见目标。我们将 SS 称为训练集,旨在找到一个低复杂度的数学模型,能够对新实例 x\mathbf{x} 有效逼近该目标函数。因此,模型的泛化能力在一个独立的集合 T={x(j)}DT=\{\mathbf{x^{(j)}}\} \subset DTST \neq S,常有 TS=T \cap S = \emptyset)上进行评估,以考察其在训练集之外的表现。然而,某些应用不仅要求在原始定义域 DD 内精确逼近,还要求在一个包含 DD 的扩展定义域 DD' 中也能精确逼近。这在涉及新结构设计、且逼近误差最小化至关重要的场景中尤为关键。例如,当通过数据驱动方法开发新材料时,AI/ML 系统可作为代理函数提供有价值的见解以指导设计过程。因此,学习到的模型可用于辅助设计新的实验室实验。本文提出一种基于连分数迭代拟合并结合加性样条模型的多变量回归方法。我们将该方法与已有技术进行比较,包括 AdaBoost、Kernel Ridge、Linear Regression、Lasso Lars、Linear Support Vector Regression、Multi-Layer Perceptrons、Random Forests、Stochastic Gradient Descent 和 XGBoost。为评估这些方法,我们聚焦于该领域一个重要问题:基于物理化学特征预测超导体的临界温度。

关键词

引用

@article{arxiv.2012.03774,
  title  = {Learning to extrapolate using continued fractions: Predicting the critical temperature of superconductor materials},
  author = {Pablo Moscato and Mohammad Nazmul Haque and Kevin Huang and Julia Sloan and Jon C. de Oliveira},
  journal= {arXiv preprint arXiv:2012.03774},
  year   = {2023}
}

备注

Submitted to Algorithms ( ISSN: 1999-4893 )