通过发现与重放潜在动作内化 LLM 推理
机器学习
2026-02-06 v1 人工智能
计算与语言
摘要
将链式思维过程内化为隐藏状态已成为扩展测试时计算量的高效范式。然而,现有的激活引导方法依赖静态控制向量,无法适应复杂推理任务中非平稳的演化。为此,我们提出了 STIR(Self-Distilled Tools for Internal Reasoning,即自我蒸馏工具用于内部推理),将推理增强重新表述为动态潜在轨迹控制问题。STIR 引入一个协同的三阶段流程:① 差分内在动作诱导收集潜在推理成功案例以形成引导原语;② 稀疏控制基构建筑选出紧凑且几何上多样化的工具库;③ 价值调制轨迹干预通过基于锚点的门控机制动态注入情境特定的冲击。对六个算术与逻辑基准测试进行大量实验,结果表明 STIR 在四个代表性模型上将平均准确率提升 1.9%至7.5%,同时将平均 token 消耗降低最高可达 35%。这些发现表明,通过动态潜在轨迹控制可实现显式链式思维的优势,将推理过程内化以绕过显式生成,同时实现更高的保真度。我们的代码已公开于 https://github.com/sznnzs/LLM-Latent-Action
引用
@article{arxiv.2602.04925,
title = {Internalizing LLM Reasoning via Discovery and Replay of Latent Actions},
author = {Zhenning Shi and Yijia Zhu and Junhan Shi and Xun Zhang and Lei Wang and Congcong Miao},
journal= {arXiv preprint arXiv:2602.04925},
year = {2026}
}