长度价值模型:面向标记级长度建模的可扩展预训练
计算与语言
2026-05-01 v1
摘要
标记是现代自回归模型中计算的基本单元,生成长度直接影响推理成本和推理性能。尽管其重要性已广为人知,但现有方法缺乏细粒度的长度建模,主要在粗粒度序列层面运作。我们提出长度价值模型(LenVM),一个面向标记级框架,建模剩余生成长度。通过将长度建模形式化为价值估计问题并为每个生成标记分配恒定负奖励,LenVM预测受限、折扣回报,用作剩余生成时域的单调代理。这一表述yield supervision that is annotation-free, dense, unbiased, and scalable. 实验在LLMs和VLMs上表明LenVM在推理时提供高度有效的信号。在LIFEBench精确长度匹配任务中,将LenVM应用于7B模型后,长度得分从30.9提升至64.8,显著优于前沿闭源模型。此外,LenVM实现了性能与效率之间的持续权衡控制。在GSM8K以200个标记为预算时,LenVM保持63%的准确率,而标记预算基线仅为6%。它还能准确预测从提示边界开始的总生成长度。最后,LenVM的标记级价值提供了生成动力学的可解释视图,揭示了特定标记如何将推理引导至更短或更长的 regime。结果表明,LenVM支持广泛的应用场景,标记长度可作为标记级价值信号有效建模,凸显了LenVM作为长度建模通用框架的潜力,以及作为长度特定价值信号以支持未来RL训练的可能性。代码已公开于https://github.com/eric-ai-lab/Length-Value-Model.
引用
@article{arxiv.2604.27039,
title = {Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling},
author = {Zhen Zhang and Changyi Yang and Zijie Xia and Zhen Yang and Chengzhi Liu and Zhaotiao Weng and Yepeng Liu and Haobo Chen and Jin Pan and Chenyang Zhao and Yuheng Bu and Alkesh Patel and Zhe Gan and Xin Eric Wang},
journal= {arXiv preprint arXiv:2604.27039},
year = {2026}
}