SHAPE: 通过势估计的阶段感知分层优势用于 LLM 推理
机器学习
2026-04-09 v1 人工智能
计算与语言
摘要
过程监督已成为增强 LLM 推理的有前景方法,但现有方法未能区分有意义的进展与单纯的冗长,导致推理能力有限且未解决的 token 效率问题。为应对这一挑战,我们提出了 SHAPE(Stage-aware Hierarchical Advantage via Potential Estimation),一个将推理形式化为通过经验可解性状态空间轨迹的框架。SHAPE 引入了一种分层信用分配机制:在片段层面,它采用阶段感知优势函数优先考虑低势状态中的高效突破;在 token 层面,它利用熵驱动的重分配来锐化执行信号。在三个基础模型和五个基准上的广泛数学推理实验表明,SHAPE 在 token 消耗减少 30% 的同时实现了平均 3% 的准确率提升。
引用
@article{arxiv.2604.06636,
title = {SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning},
author = {Zhengyang Ai and Zikang Shan and Xiaodong Ai and Jingxian Tang and Hangkai Hu and Pinyan Lu},
journal= {arXiv preprint arXiv:2604.06636},
year = {2026}
}
备注
ACL 2026 Main