中文

UltraLogic:通过大规模数据合成和双极浮点奖励增强 LLM 推理能力

计算与语言 2026-01-07 v1 人工智能

摘要

虽然大语言模型 (LLM) 在自然语言处理方面展现出巨大潜力,但复杂需要多步逻辑、计划和验证的通用推理仍是关键瓶颈。虽然基于可验证奖励的强化学习 (RLVR) 在特定领域取得成功,但该领域缺乏大规模、高质量且难度调校的数据以适用于通用推理。为此,我们提出UltraLogic,通过将问题的逻辑核心与其自然语言表达解耦,采用基于代码的求解方法自动化高质量数据生产。该框架包含数百种独特任务类型,并在十个难度水平上实现自动校准。此外,为缓解二元奖励稀疏和非负奖励陷阱,我们引入双极浮点奖励 (BFR) 机制,利用分级惩罚有效区分完美响应与逻辑缺陷响应。我们的实验表明,任务多样性是推理提升的主要驱动力,BFR 结合难度匹配策略显著提高了训练效率,引导模型达到全局逻辑最优。

关键词

引用

@article{arxiv.2601.03205,
  title  = {UltraLogic: Enhancing LLM Reasoning through Large-Scale Data Synthesis and Bipolar Float Reward},
  author = {Yile Liu and Yixian Liu and Zongwei Li and Yufei Huang and Xinhua Feng and Zhichao Hu and Jinglu Hu and Jianfeng Yan and Fengzong Lian and Yuhong Liu},
  journal= {arXiv preprint arXiv:2601.03205},
  year   = {2026}
}

备注

19 pages, 6 figures, 7 tables