中文

直面虚空 —— 在奖励稀缺时进行信息寻求式规划

人工智能 2025-12-19 v3

摘要

基于模型的强化学习 (MBRL) 通过同时训练预测未来的世界模型,从而提高模型无模型 RL 方法的样本效率。这些模型构成了训练计算和时间的绝大部分,随后用于在仿真环境中训练 actor,但一旦完成训练,这些模型便被快速丢弃。我们在本工作中展示,利用这些模型在推理阶段可显著提升样本效率。我们提出一种新方法,利用世界模型的短期潜在预测主动寻求信息丰富的状态,为传统好奇驱动方法提供原则性替代方案——后者追逐过时且不确定性较高的状态。虽然许多基于模型预测控制 (MPC) 的方法提供了类似替代方案,但通常缺乏承诺感,每次步骤都综合多个多步骤计划。为缓解此问题,我们提出了层次化规划器,动态决定何时重新规划、规划视野长度以及搜索信息的承诺程度。虽然该方法可理论上应用于任何训练自身 actor 仅使用模型生成数据的模型,但我们将其应用于 Dreamer 以说明概念。我们的方法在 MiniWorld 的程序生成迷宫中比基础 Dreamer 收敛快 50%,仅需基础 Dreamer 策略的 60% 环境步骤;在 Crafter 环境中表现出理性的探索行为,在 DeepMind Control 任务中显示出规划提升样本效率。

关键词

引用

@article{arxiv.2505.16787,
  title  = {Enter the Void - Planning to Seek Entropy When Reward is Scarce},
  author = {Ashish Sundar and Chunbo Luo and Xiaoyang Wang},
  journal= {arXiv preprint arXiv:2505.16787},
  year   = {2025}
}

备注

10 pages without appendix, 15 Figures, preprint