$\nabla$-Reasoner:基于隐空间中的测试时梯度下降的LLM推理
机器学习
2026-03-06 v1
摘要
规模化推理计算为大语言模型(LLM)带来了前所未有的推理能力。然而,现有的推理规模化方法通常依赖于低效且次优的离散搜索算法或试错式提示以提高在线策略。在本文中,我们提出-Reasoner,一种将token logits上的可微优化集成到解码循环中,以动态细化策略的迭代生成框架。我们的核心组件,可微文本优化(DTO),利用来自LLM似然性和奖励模型的梯度信号来细化文本表示。-Reasoner进一步集成了抽样拒绝和加速设计,以稳健地加快解码速度。理论上,我们表明,在样本空间中执行以最大化奖励为目标的推理时梯度下降,等价于通过KL正则化强化学习来对齐LLM策略。实证上,-Reasoner在具有挑战性的数学推理基准上实现了20%以上的准确率提升,同时将模型调用次数降低约10-40%。总体而言,本工作引入了从零阶搜索到一阶优化的范式转变,为放大LLM推理提供了高性价比的路径。
引用
@article{arxiv.2603.04948,
title = {$\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space},
author = {Peihao Wang and Ruisi Cai and Zhen Wang and Hongyuan Mei and Qiang Liu and Pan Li and Zhangyang Wang},
journal= {arXiv preprint arXiv:2603.04948},
year = {2026}
}
备注
ICLR 2026