中文

基于变更驱动的世界模型智能体

机器学习 2025-03-28 v1

摘要

稀疏奖励环境对强化学习提出了重大挑战,due to反馈稀缺。内在动机和迁移学习已成为解决这一问题的有前景的策略。将内在动机和迁移学习相结合的Change Based Exploration Transfer (CBET)技术在解决稀疏反馈方面显示出潜力,但其与现代算法的有效性尚未得到充分研究。本文为世界模型算法如DreamerV3提供了CBET的一种改编方案,并比较了DreamerV3和IMPALA智能体(带或不带CBET)在Crafter和Minigrid等稀疏奖励环境中的性能。我们的tabula rasa结果突出了CBET在Crafter中提升DreamerV3回报的可能性,但该算法在Minigrid中采用CBET时会获得次优政策,进一步降低回报。同样地,我们的迁移学习实验表明,使用内在奖励进行DreamerV3的预训练并不立即导致在Minigrid中实现最大化外在奖励的政策。总体而言,我们的结果表明,在像Crafter这样更复杂的环境中,CBET为DreamerV3提供了积极影响,但在像Minigrid这样的环境中,CBET可能产生不利影响。在后一种情况下,CBET在DreamerV3中所促进的行为可能不与环境的任务目标一致,从而导致回报降低和次优政策。

关键词

引用

@article{arxiv.2503.21047,
  title  = {World Model Agents with Change-Based Intrinsic Motivation},
  author = {Jeremias Ferrao and Rafael Cunha},
  journal= {arXiv preprint arXiv:2503.21047},
  year   = {2025}
}

备注

Submitted to Northern Lights Deep Learning Conference 2025