重新思考面向科学发现的符号回归数据集与基准
摘要
本文重新审视符号回归(SR)的数据集与评估标准,特别关注其在科学发现中的潜力。基于现有基于《费曼物理学讲义》的数据集中使用的一组公式,我们重建了120个数据集以讨论符号回归用于科学发现(SRSD)的性能。对于120个SRSD数据集中的每一个,我们仔细审查公式及其变量的性质,设计合理现实的取值采样范围,使我们的新SRSD数据集可用于评估SRSD的潜力,例如SR方法能否从此类数据集中(重新)发现物理定律。我们还创建了另外120个含冗余变量的数据集,以检验SR方法能否仅选择必要变量。此外,我们提出使用预测方程与真实方程树之间的归一化编辑距离(NED)来解决一个关键问题:现有SR度量要么是二值的,要么是给定输入下目标值与SR模型预测值之间的误差。我们使用各种代表性SR方法在新SRSD数据集上进行基准实验。实验结果表明我们提供了更现实的性能评估,且用户研究表明NED与人类判断的相关性显著优于现有SR度量。我们发布了代码仓库及240个SRSD数据集。
引用
@article{arxiv.2206.10540,
title = {Rethinking Symbolic Regression Datasets and Benchmarks for Scientific Discovery},
author = {Yoshitomo Matsubara and Naoya Chiba and Ryo Igarashi and Yoshitaka Ushiku},
journal= {arXiv preprint arXiv:2206.10540},
year = {2025}
}
备注
Accepted at DMLR. Code and datasets are available at https://github.com/omron-sinicx/srsd-benchmark https://huggingface.co/datasets/yoshitomo-matsubara/srsd-feynman_easy https://huggingface.co/datasets/yoshitomo-matsubara/srsd-feynman_medium https://huggingface.co/datasets/yoshitomo-matsubara/srsd-feynman_hard and another three sets of SRSD datasets with dummy variables