中文

SoS1:O1 和 R1 类似的推理 LLM 是 Sum-of-Square 求解器

机器学习 2025-03-03 v1

摘要

大型语言模型 (LLM) 已在各类任务中实现人类水平的熟练程度,但其进行严谨数学问题解决的能力仍是开放挑战。本文调查了一个根本且计算上不可避免的问题:给定多变量多项式是否为非负。这一问题与 Hilbert 的第十七问题密切相关,在全局多项式优化中发挥关键作用,并具有诸多应用领域。首先,我们引入 SoS-1K 数据集,包含约 1000 个多项式,以及基于五个逐步增加的挑战性标准设计的专家推理指令。评估了多个最先进的 LLM,发现没有结构化指导时,所有模型仅略高于随机猜测基准 50%。然而,高质量的推理指令显著提升了准确率,将性能提升至 81%。此外,我们的 7B 模型 SoS-7B 在 SoS-1K 上微调仅需 4 小时,即可在准确率上超越 671B 的 DeepSeek-V3 和 GPT-4o-mini,仅需分别计算时间的 1.8% 和 5%。我们的发现凸显了 LLM 在数学推理方面的潜力,能够解决 NP-hard 问题。

关键词

引用

@article{arxiv.2502.20545,
  title  = {SoS1: O1 and R1-Like Reasoning LLMs are Sum-of-Square Solvers},
  author = {Kechen Li and Wenqi Zhu and Coralia Cartis and Tianbo Ji and Shiwei Liu},
  journal= {arXiv preprint arXiv:2502.20545},
  year   = {2025}
}