中文

学习面向无约束目标导航的世界模型

机器学习 2024-11-06 v1 人工智能 机器人学

摘要

通过学习世界模型为稀疏奖励的目标导向强化学习提供了可行的途径。该方法允许智能体在不直接与环境交互的情况下进行计划动作或探索性目标,从而提高探索效率。世界模型的质量取决于其回放缓冲区中存储数据的丰富性,期望其能在记录轨迹周围的状态空间内实现合理的泛化。然而,挑战在于将所学世界模型泛化到沿记录轨迹向后或跨不同轨迹之间状态的状态转换,这阻碍了其准确建模真实世界动态的能力。为此,我们引入了一种新的目标导向探索算法 MUN(取自 "World Models for Unconstrained Goal Navigation"),该算法能够建模回放缓冲区中任意子目标状态之间的状态转换,从而促进学习导航到任何"关键"状态的策略。实验结果表明,MUN 增强了世界模型的可靠性,并显著提高了策略在新目标设置下的泛化能力。

关键词

引用

@article{arxiv.2411.02446,
  title  = {Learning World Models for Unconstrained Goal Navigation},
  author = {Yuanlin Duan and Wensen Mao and He Zhu},
  journal= {arXiv preprint arXiv:2411.02446},
  year   = {2024}
}

备注

NeurIPS2024 Poster. arXiv admin note: substantial text overlap with arXiv:2411.01396