可分解的神经符号回归
机器学习
2026-03-31 v2
摘要
符号回归(SR)通过发现捕捉观测数据中潜在关系的数学表达式来对复杂系统进行建模。然而,大多数 SR 方法优先考虑最小化预测误差,而不是识别控制方程,通常会产生过于复杂或不准确的表达式。为了解决这个问题,我们提出了一种可分解的 SR 方法,该方法利用 Transformer 模型、遗传算法(GA)和遗传规划(GP)生成可解释的多变量表达式。具体而言,我们的可解释 SR 方法将训练好的“不透明”回归模型提炼为数学表达式,以此作为对其所计算函数的解释。我们的方法采用 Multi-Set Transformer 生成多个单变量符号骨架,以表征每个变量如何影响不透明模型的响应。然后,我们使用基于 GA 的方法评估生成骨架的性能,以选择高质量候选者的子集,再通过基于 GP 的级联过程逐步合并它们,同时保留其原始骨架结构。最终的多变量骨架通过 GA 进行系数优化。我们在具有可控且不同程度噪声的问题上评估了我们的方法,与两种基于 GP 的方法、三种神经 SR 方法和一种混合方法相比,展现出更低或相当的插值和外推误差。与它们不同的是,我们的方法始终学习到与原始数学结构相匹配的表达式。同样,在 Feynman 数据集上,我们的方法相对于基准方法实现了高符号解恢复率和具有竞争力的预测性能。
引用
@article{arxiv.2511.04124,
title = {Decomposable Neuro Symbolic Regression},
author = {Giorgio Morales and John W. Sheppard},
journal= {arXiv preprint arXiv:2511.04124},
year = {2026}
}
备注
Under review as submission to TMLR