一种用于高效科学发现的统一数据驱动框架
计算工程、金融与科学
2025-09-10 v1
摘要
科学发现推动着从基础物理到工业应用等各个学科的进步。然而,从收集到的数据集中自动识别物理定律需要确定数据背后公式的结构和参数,这涉及在巨大的搜索空间中导航并消耗大量的计算资源。为了解决这些问题,我们基于 Buckingham Π 定理和 Taylor 定理,创建了多种公式的统一表示,该表示引入潜变量以形成两阶段结构。为了最小化搜索空间,我们首先专注于确定潜公式的结构,包括相关的贡献输入、潜变量的数量及其相互连接。随后,通过施加维度约束以保证物理相关性、偏好公式的简洁性以及采用策略性优化技术,加快了参数识别的过程。任何过于复杂的结果都使用符号回归进行精炼,以获得紧凑的形式。这些通用的策略性技术将搜索迭代次数从数亿次大幅减少到仅数十次,显著提高了数据驱动公式发现的效率。我们进行了全面的验证,以证明 FIND 在天文学、物理学、化学和电子学等多个领域发现物理定律、无量纲数、偏微分方程和统一临界系统参数方面的有效性。在 11 个不同数据集上的优异表现,使 FIND 成为在多个领域推进数据驱动科学发现的强大且通用的工具。
引用
@article{arxiv.2509.07303,
title = {A Unified Data-Driven Framework for Efficient Scientific Discovery},
author = {Tingxiong Xiao and Xinxin Song and Ziqian Wang and Boyang Zhang and Jinli Suo},
journal= {arXiv preprint arXiv:2509.07303},
year = {2025}
}