中文

Logit Arithmetic 在无需训练的情况下激发长推理能力

计算与语言 2026-04-21 v2

摘要

大推理模型展现出具有回溯和自验证等复杂策略的长思维链推理。然而,这些能力通常需要资源密集的后训练。我们研究是否可以在不进行任何梯度更新的情况下在大模型中激发此类行为。为此,我们提出了一种解码时方法ThinkLogit,它利用logit算术将能力从规模小得多的推理引导器转移到大型非推理目标模型上。我们进一步表明,我们可以通过在混合模型输出上使用偏好优化来训练引导器以纠正目标的错误,从而提升性能,我们将其称为ThinkLogit-DPO。我们在六个涵盖数学、科学和编码领域的推理基准上评估了这些方法,使用Qwen2.5-32B由R1-Distill-Qwen-1.5B引导,后者规模小21倍。我们的实验表明ThinkLogit和ThinkLogit-DPO相对于目标模型分别实现了21.5%和24.2%的相对提升。此外,当引导器和目标来自不同模型族时,ThinkLogit仍然有效。关键的是,我们的方法对大型模型零训练,并且当logit并行计算时仅产生最小的推理开销,为在大规模上实现长推理提供了一个实用的解决方案。

关键词

引用

@article{arxiv.2510.09354,
  title  = {Logit Arithmetic Elicits Long Reasoning Capabilities Without Training},
  author = {Yunxiang Zhang and Muhammad Khalifa and Lechen Zhang and Xin Liu and Ayoung Lee and Xinliang Frederick Zhang and Farima Fatahi Bayat and Lu Wang},
  journal= {arXiv preprint arXiv:2510.09354},
  year   = {2026}
}

备注

Accepted to ACL Findings 2026