Mind Dreamer:通过潜在流形上的主动因果干预释放想象力
机器学习
2026-05-28 v2 机器人学
摘要
基于模型的强化学习通过潜在想象力获得样本效率,但仍受限于历史束缚:想象力通常从观测到的状态初始化。这造成了一种学习不对称性,即世界模型的流形发现速度超过了策略的稀疏奖励优化速度。我们提出 Mind Dreamer(MD),这是一个实例化主动因果干预以超越马尔可夫连续性的框架。MD 将发现重新定义为全局中继期望自由能的最小化。它不从历史数据初始化,而是从对抗生成器 中抽取初始状态,创造出非连续的潜在跳跃,到达物理上合理但认知上具有挑战性的认知盲点。我们推导出中继价值函数和中继不确定性函数,以解决跨越这些空间断裂的信用分配悖论。通过将合成的锚点视为干预性的中间状态,这些势能通过贝尔曼式备份传播实用价值和认知价值。值得注意的是,我们证明了跨不连续性的不确定性传播需要二次折扣 ,从而建立了一个形式化的认知视界。理论上,MD 近似于一个方差最小化的重要性采样器,它扩展了流形的谱隙,减少了到达关键瓶颈状态的命中时间。在实证上,MD 在 DeepMind Control Suite 上相比 DreamerV3 实现了平均 1.67 倍的加速,在稀疏奖励任务中加速达到 8.8 倍。
引用
@article{arxiv.2605.16030,
title = {Mind Dreamer: Untethering Imagination via Active Causal Intervention on Latent Manifolds},
author = {Shaojun Xu and Xiaoling Zhou and Yihan Lin and Yapeng Meng and Xinglong Ji and Luping Shi and Rong Zhao},
journal= {arXiv preprint arXiv:2605.16030},
year = {2026}
}
备注
34 pages, 7 figures, ICML 2026 accepted