通过端到端符号回归加速对科学实验的理解
机器学习
2021-12-09 v1 人工智能
摘要
我们考虑从原始数据(例如任何科学领域的实验所产生的数据)中学习自由形式符号表达式的问题。准确且可解释的科学现象模型是科学研究的基石。简单但可解释的模型,如线性或逻辑回归以及决策树,往往缺乏预测准确性。另一方面,准确的黑箱模型,如深度神经网络,提供了高预测准确性,但不易于以丰富科学现象理论的方式为人类所理解。科学上的许多重大突破都围绕着发展具有高预测准确性的简约方程模型,例如牛顿定律、万有引力和麦克斯韦方程组。先前从数据中自动搜索方程模型的工作结合了领域特定的启发式方法以及计算成本高昂的技术,如遗传编程和蒙特卡洛搜索。我们开发了一个深度神经网络(MACSYMA),将符号回归问题作为一个端到端的监督学习问题来解决。MACSYMA可以生成描述数据集的符号表达式。该任务的计算复杂度被降低到神经网络的前馈计算。我们在一个由不同长度和不同噪声水平的数据表组成的合成数据集上训练我们的神经网络,网络必须学会逐令牌地生成正确的符号表达式。最后,我们通过在行为科学的一个公共数据集上运行来验证我们的技术。
引用
@article{arxiv.2112.04023,
title = {Accelerating Understanding of Scientific Experiments with End to End Symbolic Regression},
author = {Nikos Arechiga and Francine Chen and Yan-Ying Chen and Yanxia Zhang and Rumen Iliev and Heishiro Toyoda and Kent Lyons},
journal= {arXiv preprint arXiv:2112.04023},
year = {2021}
}