中文

视界想象:扩散世界模型中的高效在策略推演

机器学习 2026-02-18 v2

摘要

我们研究扩散-based 世界模型用于强化学习,该方法在生成保真度方面表现良好,但在控制领域面临效率挑战。当前方法要么在推理时需要重型模型,要么依赖高度顺序的想象,两者都导致不可接受的计算成本。我们提出了视界想象(Horizon Imagination, HI),这是一种用于离散随机策略的在策略推演process。HI 并行地对多个未来观测进行去噪。HI 融入了稳定机制和新颖的采样计划,该计划将去噪预算与去噪应用范围(即有效 horizon)相分离,同时支持子帧预算。在 Atari 100K 和 Craftium 上的实验表明,我们的方法在去噪步骤数减半的子帧预算下仍能维持控制性能,并在各种计划下实现优越的生成质量。代码已公开于 https://github.com/leor-c/horizon-imagination。

关键词

引用

@article{arxiv.2602.08032,
  title  = {Horizon Imagination: Efficient On-Policy Rollout in Diffusion World Models},
  author = {Lior Cohen and Ofir Nabati and Kaixin Wang and Navdeep Kumar and Shie Mannor},
  journal= {arXiv preprint arXiv:2602.08032},
  year   = {2026}
}

备注

This paper will be published in the ICLR 2026 proceedings