中文

关注模型而非智能体:基于模型的强化学习中的首要偏差

机器学习 2024-08-20 v3 人工智能

摘要

无模型强化学习(MFRL)中的首要偏差,指智能体过度拟合早期数据并丧失从新数据学习能力的倾向,会显著降低MFRL算法的性能。先前研究表明,采用重置智能体参数等简单技术可大幅缓解MFRL中的首要偏差。然而,基于模型的强化学习(MBRL)中的首要偏差尚未被探索。本工作中,我们聚焦于研究MBRL中的首要偏差。我们首先观察到,在MBRL背景下重置智能体参数会损害其性能。我们进一步发现,MBRL中的首要偏差与世界模型的首要偏差而非智能体的首要偏差更为相关。基于该发现,我们提出“世界模型重置”,一种简单而有效的技术以缓解MBRL中的首要偏差。我们将该方法应用于两种不同的MBRL算法MBPO和DreamerV2。我们在MuJoCo和DeepMind Control Suite的多个连续控制任务以及Atari 100k基准的离散控制任务上验证了方法的有效性。实验结果表明,世界模型重置能显著缓解基于模型设定下的首要偏差并提升算法性能。我们还给出了如何有效执行世界模型重置的指南。

关键词

引用

@article{arxiv.2310.15017,
  title  = {Mind the Model, Not the Agent: The Primacy Bias in Model-based RL},
  author = {Zhongjian Qiao and Jiafei Lyu and Xiu Li},
  journal= {arXiv preprint arXiv:2310.15017},
  year   = {2024}
}

备注

Accepted by European Conference on Artificial Intelligence (ECAI) 2024