中文

基于基础模型蒸馏的数据高效符号回归

机器学习 2025-08-28 v1 人工智能

摘要

从观测数据中发现可解释的数学方程(即方程发现或符号回归)是科学发现的基石,能够实现对物理、生物和经济系统的透明建模。虽然基于大规模方程数据集预训练的基础模型提供了有前景的起点,但在应用于小规模、领域特定数据集时常常出现负迁移并表现差。本文引入EQUATE(Equation Generation via QUality-Aligned Transfer Embeddings,基于质量对齐迁移嵌入的数学方程生成),构建一种数据高效的微调框架,通过蒸馏为低数据情境下的符号方程发现适配基础模型。EQUATE结合符号-数值对齐与评估器引导的嵌入优化,实现了嵌入-搜索-生成的原则化范式。我们的ethods将离散方程搜索重新表述为在共享嵌入空间中的连续优化任务,由数据-方程适配度和简洁性指导。基于Feynman、Strogatz和黑箱数据集三个标准公开基准的实验表明,EQUATE在准确性和鲁棒性方面均显著优于最新基线,同时保持低复杂度和快速推理。这些结果突显了EQUATE作为数据高效符号回归中实用且可推广的解决方案。

关键词

引用

@article{arxiv.2508.19487,
  title  = {Data-Efficient Symbolic Regression via Foundation Model Distillation},
  author = {Wangyang Ying and Jinghan Zhang and Haoyue Bai and Nanxu Gong and Xinyuan Wang and Kunpeng Liu and Chandan K. Reddy and Yanjie Fu},
  journal= {arXiv preprint arXiv:2508.19487},
  year   = {2025}
}