您的潜在推理实际上是秘密策略改进算子
计算与语言
2026-02-06 v4 人工智能
机器学习
摘要
最近, 小模型通过潜在递归在复杂推理任务上取得了令人瞩目的成果.这些结果通常归因于该递归增加网络深度, 使其能够紧凑地模拟更大模型的能力.然而, 递归添加的层的性能仍落后于具有相同前馈深度的单遍模型.这意味着在循环版本中, 并非每一步递归都有效地为深度贡献.这引出了一个问题:潜在推理何时时何时时有效提升性能, 何时时何时时导致无效计算?本文中我们分析了潜在推理提供的算法, 并给出该问题的答案.我们展示, 潜在推理可以形式化为一种分类器自由引导和策略改进算法.基于这些见解, 我们提出使用来自强化学习和扩散方法的训练方案用于潜在推理模型.以 Tiny Recursive Model 为测试平台, 我们表明通过我们的修改可避免无效计算步骤, 并在保持性能的同时将前向传递次数缩减 18 倍.广义而言, 我们表明, 策略改进视角下的递归步骤可以解释模型行为, 并为进一步改进提供启发.
引用
@article{arxiv.2511.16886,
title = {Your Latent Reasoning is Secretly Policy Improvement Operator},
author = {Arip Asadulaev and Rayan Banerjee and Fakhri Karray and Martin Takac},
journal= {arXiv preprint arXiv:2511.16886},
year = {2026}
}