RuPLaR:基于规则先验的 LLM 推理链高效隐压缩——从多步到单步
计算与语言
2026-05-12 v1 人工智能
摘要
思维链(Chain-of-Thought, CoT)范式虽然增强了大型语言模型(LLM)的可解释性,但受到自然语言低效性和表达局限性的制约。在连续隐空间中操作的隐思维链(latent CoT)推理提供了一种有前景的替代方案,但面临现有单模型或多模型范式中结构复杂性的挑战,例如错误传播和协调开销。在本文中,我们提出了 One-Model One-Step,一种基于规则先验的隐压缩推理框架(Latent Reasoning with Rule-Based Priors, RuPLaR)来应对这一挑战。我们的方法在基于规则的先验概率分布引导下,训练 LLM 在单一训练阶段自主生成隐推理 token,从而消除级联过程和模型间依赖。为确保推理质量,我们设计了一个联合训练目标:通过交叉熵强制答案一致性,通过 KL 散度将软 token 与规则先验对齐(Soft Thinking 约束),并在表示空间中加入问题-思维语义对齐约束。大量实验表明,我们的压缩框架不仅比现有隐 CoT 方法提高了 11.1% 的准确率,而且以最少的 token 使用量实现了这一点,凸显了其有效性和可扩展性。代码:https://github.com/xiaocen-luo/RuPLaR。
引用
@article{arxiv.2605.09346,
title = {RuPLaR : Efficient Latent Compression of LLM Reasoning Chains with Rule-Based Priors From Multi-Step to One-Step},
author = {Xiaocheng Luo and Kang Wang and Zaifu Zhan and Yuechi Zhou and Xiangyu Duan},
journal= {arXiv preprint arXiv:2605.09346},
year = {2026}
}
备注
15 pages, 15 figures