中文

基于模型的强化学习中目标错配问题的统一视角

机器学习 2024-04-09 v2

摘要

基于模型的强化学习(MBRL)旨在通过显式学习环境模型,使智能体更具样本效率、适应性和可解释性。尽管近年来 MBRL 智能体的能力显著提升,但如何最佳地学习模型仍是一个未解决的问题。大多数 MBRL 算法旨在训练模型以对环境做出准确预测,随后利用该模型确定回报最高的动作。然而,近期研究表明,模型预测精度通常与动作质量无关,其根源在于准确的动态模型学习与奖励策略优化之间的目标错配。随着 MBRL 作为一个研究领域的不断成熟,针对目标错配问题已涌现出若干相互关联的解决类别。在本文中,我们深入调研了这些解决类别,并提出了一种分类体系以促进未来研究。

关键词

引用

@article{arxiv.2310.06253,
  title  = {A Unified View on Solving Objective Mismatch in Model-Based Reinforcement Learning},
  author = {Ran Wei and Nathan Lambert and Anthony McDonald and Alfredo Garcia and Roberto Calandra},
  journal= {arXiv preprint arXiv:2310.06253},
  year   = {2024}
}