推动自然推理边界:基于形式逻辑验证的交错奖励
机器学习
2026-02-02 v1
摘要
大型语言模型(LLM)展现出惊人的能力,但其基于随机下一个标记的预测机制导致逻辑不一致和奖励攻击,这类问题形式符号系统能避免。为弥合这一鸿沟,我们引入一种形式逻辑验证导向的框架,动态交错进行形式符号验证与自然语言生成过程,提供实时反馈以检测并纠正错误。与之前受限于被动事后验证的神经符号方法不同,我们的方法在推理链的中间阶段积极惩罚中间谬误。我们通过一种新颖的两阶段训练管线实现该框架,协同形式逻辑验证导向的监督微调与策略优化。对六项涵盖数学、逻辑及通用推理基准的广泛评估表明,我们的 7B 和 14B 模型分别在与最先进基线之间取得平均提升 10.4% 和 14.2%。这些结果验证了形式验证可作为一种可扩展的机制,显著推动了先进 LLM 推理性能的边界。
引用
@article{arxiv.2601.22642,
title = {Pushing the Boundaries of Natural Reasoning: Interleaved Bonus from Formal-Logic Verification},
author = {Chuxue Cao and Jinluan Yang and Haoran Li and Kunhao Pan and Zijian Zhao and Zhengyu Chen and Yuchen Tian and Lijun Wu and Conghui He and Sirui Han and Yike Guo},
journal= {arXiv preprint arXiv:2601.22642},
year = {2026}
}