中文

合成数据能否提升符号回归外推性能?

机器学习 2025-12-01 v1

摘要

许多机器学习模型在训练数据范围内进行预测时表现良好,但在需要超出数据范围的外推时往往难以承担。符号回归(SR)采用遗传编程(GP)可生成灵活的模型,但易在外推情境下表现不可靠。本文探讨是否可以通过引入合成数据来提升此类情境下的性能。我们采用核密度估计(KDE)识别训练数据稀疏的输入空间区域,然后利用知识蒸馏方法在这些区域生成合成数据:教师模型在新输入点上生成预测结果,这些结果随后用于训练学生模型。我们在六个基准数据集上进行评估,分别以神经网络(NN)、随机森林(RF)和 GP 作为教师模型(生成合成数据)和学生模型(训练于增广数据)。结果表明,GP 模型常能在使用合成数据训练后提升性能,尤其是在外推区域。然而,改进程度取决于数据集和所选教师模型。最显著的提升出现在使用 GPe 生成的合成数据训练 GPp 的情况下。插值区域的模型性能变化仅为轻微。我们还观察到模型性能在输入空间不同区域呈现异构误差。总体而言,这一方法为改善外推提供了一条实用途径。注意:本工作的早期版本已发表于 GECCO 2025 符号回归研讨会。本 arXiv 版本纠正了原稿的若干部分。

关键词

引用

@article{arxiv.2511.22794,
  title  = {Can Synthetic Data Improve Symbolic Regression Extrapolation Performance?},
  author = {Fitria Wulandari Ramlan and Colm O'Riordan and Gabriel Kronberger and James McDermott},
  journal= {arXiv preprint arXiv:2511.22794},
  year   = {2025}
}

备注

8 pages, 16 figures, GECCO 2025 Symbolic Regression Workshop