PonderLM-3:基于可微掩码的自适应标记级思考
计算与语言
2026-03-11 v2
摘要
测试时扩展表明,在推理时分配更多额外计算可提高生成质量,这自然引出一个问题:额外计算应如何分配?基于这一洞见,我们引入 PonderLM-3,一个用于标记级自适应思考的预训练框架,能够在纯自监督目标下学习选择性分配额外计算的能力,基于 PonderLM-2 架构构建。这样,额外推理计算即可作为可分配的标记资源,只有在有益时才为标记分配更多计算,而非对每个标记统一支付额外成本。为在训练-推理一致性下实现可学习的分配,PonderLM-3 在预训练期注入可微注意力掩码,并在推理时配对匹配的硬性剪枝规则。PonderLM-3 定义更强的 Pareto 前沿:相较于现有递归或自适应基线,在相同推理 FLOPs 下实现更低的预训练困惑度。在下游基准测试中,PonderLM-3 在相同最大额外计算步骤数下,实现了与固定步骤 PonderLM-2 相当的性能,同时在实际推理中使用的 FLOPs 更少。总体而言,PonderLM-3 提供了一个端到端可微且训练-推理一致的标记级自适应计算框架,使额外推理计算能够在最有价值的地方分配,而非对每个标记统一支付费用。
引用
@article{arxiv.2603.02023,
title = {PonderLM-3: Adaptive Token-Wise Pondering with Differentiable Masking},
author = {He Li and Feichen Song and Boyi Zeng and Shixiang Song and Zhiqin John Xu and Ziwei He and Zhouhan Lin},
journal= {arXiv preprint arXiv:2603.02023},
year = {2026}
}