利用预训练大语言模型进行物理信息符号回归的知识集成
机器学习
2025-09-04 v1 人工智能
信息检索
符号计算
摘要
符号回归 (SR) 作为自动化科学发现的强大工具,使人们能够从实验数据中推导支配方程。越来越多的研究表明,将领域知识整合到SR中可提高所发现方程的普适性和实用性。物理信息驱动的SR (PiSR) 通过纳入领域知识来实现这一目标,但当前方法往往需要专业化的表述和手动特征工程,限制了其仅限于领域专家。本研究利用预训练大语言模型 (LLM) 来促进PiSR中的知识集成。通过利用在广泛科学文献上训练的LLM的语境理解能力,我们旨在自动整合领域知识,减少对手动干预的需求,使过程更易于适用于更广泛的科学问题。具体而言,将LLM集成到SR的损失函数中,添加LLM对SR产生的方程进行评估的项。我们使用三种SR算法 (DEAP、gplearn和PySR) 和三种预训练LLM (Falcon、Mistral和LLama 2) 进行了广泛评估,涵盖三个物理动力学场景:自由落体、简谐振动和电磁波。结果表明,LLM集成在从数据重建物理动力学方程方面始终具有改进作用,增强了SR模型对噪声和复杂性的鲁棒性。我们进一步探讨了提示工程的影响,发现更具信息性的提示显著提升了性能。
引用
@article{arxiv.2509.03036,
title = {Knowledge Integration for Physics-informed Symbolic Regression Using Pre-trained Large Language Models},
author = {Bilge Taskin and Wenxiong Xie and Teddy Lazebnik},
journal= {arXiv preprint arXiv:2509.03036},
year = {2025}
}