中文

测试时计算能否缓解神经符号回归中的复制偏差?

机器学习 2026-02-03 v2

摘要

数学表达式在科学发现中发挥着核心作用。符号回归旨在从给定的数值数据中自动发现此类表达式。近期,涉及在合成数据集上预训练 Transformer 的神经符号回归 (NSR) 方法因其快速推理而备受关注,但它们通常表现不佳,尤其是在输入变量较多时。在本研究中,我们从理论和经验两个角度分析了 NSR,并表明:(1) 普通的逐 token 生成不适用于 NSR,因为 Transformer 无法在验证数值一致性的同时组合生成 token;(2) 由于复制偏差,NSR 方法的搜索空间受到极大限制,生成的大多数表达式仅仅是从训练数据中复制而来的。我们进一步探讨了定制的测试时策略能否减少复制偏差,并表明在测试时提供额外信息可有效缓解该偏差。这些发现有助于更深入地理解 NSR 方法的局限性,并为设计更鲁棒、更具泛化能力的方法提供指导。代码可在 https://github.com/Shun-0922/Mem-Bias-NSR 获取。

关键词

引用

@article{arxiv.2505.22081,
  title  = {Can Test-time Computation Mitigate Reproduction Bias in Neural Symbolic Regression?},
  author = {Shun Sato and Issei Sato},
  journal= {arXiv preprint arXiv:2505.22081},
  year   = {2026}
}