中文

用于离线强化学习的温和保守Q学习

机器学习 2024-02-22 v3 人工智能

摘要

离线强化学习(RL)定义了从静态记录数据集中学习而不与环境持续交互的任务。所学策略与行为策略之间的分布偏移使得价值函数必须保持保守,以避免分布外(OOD)动作被严重高估。然而,现有方法惩罚未见过动作或以行为策略正则化过于悲观,抑制了价值函数的泛化并阻碍了性能提升。本文探索了离线学习中温和但充分的保守性,同时不损害泛化。我们提出温和保守Q学习(MCQ),通过为OOD动作分配适当的伪Q值来主动训练它们。我们从理论上表明,MCQ诱导的策略表现至少与行为策略一样好,且不会对OOD动作产生错误的高估。在D4RL基准上的实验结果表明,MCQ相较于先前工作取得了卓越性能。此外,MCQ在从离线到在线迁移时展现出优越的泛化能力,并显著优于基线。我们的代码公开于 https://github.com/dmksjfl/MCQ。

关键词

引用

@article{arxiv.2206.04745,
  title  = {Mildly Conservative Q-Learning for Offline Reinforcement Learning},
  author = {Jiafei Lyu and Xiaoteng Ma and Xiu Li and Zongqing Lu},
  journal= {arXiv preprint arXiv:2206.04745},
  year   = {2024}
}

备注

NeurIPS 2022