基于遗传编程的符号回归泛化界限分析
机器学习
2026-04-21 v1 神经与进化计算
摘要
符号回归(Symbolic Regression, SR)通过遗传编程(Genetic Programming, GP)旨在从数据中直接发现可解释的数学表达式。尽管其在实际应用中表现优异,但关于 GP-based SR 为什么能在训练数据之外实现泛化的理论理解仍有限。本文对表示为表达式树的 SR 模型进行学习论证分析。在树的大小、深度和可学习常数受限条件下,我们推导了 GP 风格 SR 的泛化界限。我们的结果将泛化间隙分解为两个可解释组成部分:结构选择项,反映选择表达式树结构的组合复杂性;常数拟合项,捕捉在固定结构内优化数值常数的复杂性。该分解为 GP 中几项常用实践提供了理论视角,包括惩罚因子、深度限制、数值稳定算子以及区间算术。在 particular,我们的分析表明,结构限制如何减少假设类增长,稳定性机制如何控制预测对参数扰动的敏感性。通过将这些实际设计选择链接到泛化界限中的显式复杂性项,本文为 GP-based SR 中常见的经验行为提供原则性解释,并促进了对其泛化性质的更严格理解。
引用
@article{arxiv.2604.17402,
title = {On the Generalization Bounds of Symbolic Regression with Genetic Programming},
author = {Masahiro Nomura and Ryoki Hamano and Isao Ono},
journal= {arXiv preprint arXiv:2604.17402},
year = {2026}
}