中文

通过强化反馈桥接方程蒸馏中的领域差距

机器学习 2025-05-22 v1 人工智能

摘要

数据到方程(Data2Eqn)任务旨在发现解释性数学方程,将观察值映射到标签,提供物理洞察并在学术和工业领域具有广泛适用性。遗传编程和传统深度学习方法存在搜索效率低和在小任务特定数据集上的泛化差的问题。基础模型在该领域显示出前景,但现有方法存在:1)它们在通用数据分布上进行预训练,对特定任务效果有限;2)它们的训练目标侧重于标记级对齐,忽略数学语义,可能导致不准确的方程。为解决这些问题,我们旨在增强基础模型在 Data2Eqn 任务中的领域适应性。本文提出一种基于强化学习的微调框架,直接通过来自下游数值适应度的奖励信号优化预训练模型的生成策略。该方法使模型能够适应特定和复杂的数据分布,生成数学上有意义的方程。大量实验表明,我们的方法在复杂分布下提高了方程生成的准确性和鲁棒性。

关键词

引用

@article{arxiv.2505.15572,
  title  = {Bridging the Domain Gap in Equation Distillation with Reinforcement Feedback},
  author = {Wangyang Ying and Haoyue Bai and Nanxu Gong and Xinyuan Wang and Sixun Dong and Haifeng Chen and Yanjie Fu},
  journal= {arXiv preprint arXiv:2505.15572},
  year   = {2025}
}