中文

Logit 算术无需训练即可激发长推理能力

计算与语言 2025-07-18 v1 人工智能

摘要

大型推理模型 (LRMs) 可以通过包含回溯和自我纠正等认知策略的长链式思维 (CoT) 实现复杂推理。最近的研究表明,一些模型本就具备这些长推理能力,可能通过额外训练来激活。我们的工作首先研究了是否可以在无任何训练的情况下激活此类行为。为此,我们提出了一种解码时方法 ThinkLogit,该方法利用 logits 算术 (Liu 等,2024) 来调节目标大型语言模型,以小型模型作为引导器实现长推理。我们进一步通过在来自目标模型和引导模型的正确/错误推理对中抽样的偏好优化来训练引导器模型,从而进一步提升性能,我们将这种设置称为 ThinkLogit-DPO。我们的实验表明,ThinkLogit 和 ThinkLogit-DPO 在使用 Qwen2.5-32B 时,由 R1-Distill-Qwen-1.5B 引导,可分别相对于基线实现约 26% 和 29% 的 pass@1 提升。最后,我们展示 ThinkLogit 可以传递通过强化学习获得的长推理技能,使 Qwen2.5-32B 基线模型的 pass@1 提升约 13%。我们的工作提出了一种高效的方法,在最小或无额外训练的情况下激发大型模型的长推理能力。

关键词

引用

@article{arxiv.2507.12759,
  title  = {Logit Arithmetic Elicits Long Reasoning Capabilities Without Training},
  author = {Yunxiang Zhang and Muhammad Khalifa and Lechen Zhang and Xin Liu and Ayoung Lee and Xinliang Frederick Zhang and Farima Fatahi Bayat and Lu Wang},
  journal= {arXiv preprint arXiv:2507.12759},
  year   = {2025}
}