中文

通过变分同态映射在选项诱导抽象 MDP 中学习时序抽象

人工智能 2025-07-25 v2

摘要

大语言模型(LLMs)通过显式链式思维(Chain-of-Thought, CoT)提示显示出惊人的推理能力,但生成这些逐步文本解释的过程计算成本高且速度慢。为克服这一问题,我们致力于开发一种高效的隐式推理框架,使模型在不为每一步生成显式文本的情况下在潜在空间中“思考”。我们提出,这些潜在思考可以建模为层次强化学习框架中作为时序扩展抽象动作(options)的 latent thoughts。为有效学习作为 latent 嵌入的 diverse 选项库,我们首先引入 Variational Markovian Option Critic(VMOC),这是一种在 HiT-MDP 框架下使用变分推断的 off-policy 算法。为为这些选项作为抽象推理空间提供严格理论基础,我们扩展了连续 MDP 同态映射的理论。这证明了在简化的抽象潜在空间上学习策略(VMOC 适用)会保留原始复杂问题解的最优性。最后,我们提出一种 cold-start 程序,利用监督微调(SFT)数据将人类推理演示蒸馏到这种潜在选项空间中,为模型推理能力提供丰富的初始化。大量实验表明,我们的方法在复杂逻辑推理基准和具挑战性的 locomotion 任务上取得优异成绩,验证了该框架是一种为语言和控制学习抽象技能的原则方法。

关键词

引用

@article{arxiv.2507.16473,
  title  = {Learning Temporal Abstractions via Variational Homomorphisms in Option-Induced Abstract MDPs},
  author = {Chang Li and Yaren Zhang and Haoran Lv and Qiong Cao and Chao Xue and Xiaodong He},
  journal= {arXiv preprint arXiv:2507.16473},
  year   = {2025}
}