学会深思:潜空间中的自适应推理
人工智能
2025-09-30 v1 计算与语言
摘要
测试时计算已成为增强 LLM 推理的关键范式,但现有方法如 Best-of-N 和多数投票对所有输入统一施加推理深度,浪费简单查询的计算资源,同时可能思考不足。我们提出 FR-Ponder,一个单图、主干训练无关的框架,通过潜空间引导分配实例自适应的推理计算。一个不到 1M 参数的控制器观测隐藏状态并决定停止或应用一个小的深思步骤,即向冻结表示中添加一个预计算的引导向量。我们的方法提取与更深推理输出及直接输入输出相关的潜空间引导向量,并通过可调缩放因子重新应用,使模型能够根据每个输入的复杂性自适应调整推理深度。为平衡性能与计算成本,我们采用组相对策略优化(GRPO)作为奖励信号来自适应调节推理深度,在实现任务精度的同时抑制过度推理。通过课程学习和精心的奖励工程设计,FR-Ponder 学会了与问题难度相关的校准计算分配。在 GSM8K 和 MATH500 上,FR-Ponder 改进了计算-精度前沿,以更低的 FLOPs 实现了更好的匹配精度,并与早期退出基线进行了有利比较,且无需修改主干权重。分析可视化了可解释的引导方向,并展示了学到的计算分配与问题难度的相关性。
引用
@article{arxiv.2509.24238,
title = {Learning to Ponder: Adaptive Reasoning in Latent Space},
author = {Yixin He and Lumingyuan Tang},
journal= {arXiv preprint arXiv:2509.24238},
year = {2025}
}