符号回归模型选择准则的比较研究
机器学习
2026-05-13 v1
摘要
有效的模型选择在符号回归(SR)中至关重要,用于识别在准确性和复杂度之间取得平衡、且在不可见数据上的预期误差较低的数学表达式。许多现代遗传编程(GP)用于 SR 的实现会生成一组帕累托最优候选解,但可靠的自动选择能够在不可见数据上获得低误差的解决方案仍是开放问题。当前文献提供了各种信息论和贝叶斯方法,但针对不同数据情形的综合性能比较有限。本研究对广泛使用的选择准则进行系统经验比较:阿卡伊信息准则(AIC)、修正后的 AIC(AICc)、贝叶斯信息准则(BIC)、最小描述长度(MDL),以及 Efron 的 bootstrap 估计用于样本内预测误差,对七个带有高斯噪声的合成数据集进行测试。我们通过扰动真实函数来生成候选表达式,以评估其泛化误差和选择概率。我们的发现表明,MDL 在大多数数据集上始终识别出误差最低且长度最短的模型。虽然没有单一准则在所有结果中都占据统治地位,但 MDL 和 BIC 产生了最高的选择真实表达式的概率。
引用
@article{arxiv.2605.11233,
title = {A Comparative Study of Model Selection Criteria for Symbolic Regression},
author = {Ali Soltani and Gabriel Kronberger and Fabricio Olivetti de Franca and Mattia Billa and Alessandro Lucantonio},
journal= {arXiv preprint arXiv:2605.11233},
year = {2026}
}