中文

基于下界Expectile Q学习的模型基线离线强化学习

机器学习 2024-12-04 v2 人工智能

摘要

模型基线离线强化学习(RL)是一种解决仅能从有限静态数据中学习的挑战的方法,通过 learned models 生成虚构轨迹。然而,这类方法往往在模型 rollout 的 value estimation 上存在偏差。本文引入一种新颖的模型基线离线RL方法——下界Expectile Q学习(Lower Expectile Q-learning,LEQ),通过对λ\lambda-returns进行下界Expectile回归,提供低偏差的模型基线 value estimation。我们的实验结果表明,LEQ在长期程度任务上(如D4RL AntMaze任务)显著优于以前的模型基线离线RL方法,达到了或超越了 model-free 方法和 sequence modeling 方法的性能。此外,LEQ在稠密奖励环境中表现出色,涵盖基于状态的任务(NeoRL和D4RL)以及基于像素的任务(V-D4RL),显示出在多样化领域中具有稳健性。我们的消融研究表明,下界Expectile回归、λ\lambda-returns以及在离线数据上进行critic训练都是LEQ不可或缺的因素。

关键词

引用

@article{arxiv.2407.00699,
  title  = {Model-based Offline Reinforcement Learning with Lower Expectile Q-Learning},
  author = {Kwanyoung Park and Youngwoon Lee},
  journal= {arXiv preprint arXiv:2407.00699},
  year   = {2024}
}

备注

https://kwanyoungpark.github.io/LEQ/