中文

基于策略上 Q 函数正则化的离线强化学习

机器学习 2023-07-27 v1 人工智能

摘要

离线强化学习(RL)的核心挑战是处理由历史数据集与期望策略之间的分布偏移所引起的(潜在的灾难性)外推误差。大量先前工作通过隐式或显式地将学习策略正则化以逼近行为策略来应对该挑战,而行为策略在实践中难以可靠估计。本工作中,我们提出改为正则化至行为策略的 Q 函数而非行为策略本身,其前提是 Q 函数可通过 SARSA 风格的估计更可靠且容易地估计,并能更直观地处理外推误差。我们提出两种利用所估计 Q 函数进行正则化的算法,并证明它们在 D4RL 基准上展现出强劲性能。

关键词

引用

@article{arxiv.2307.13824,
  title  = {Offline Reinforcement Learning with On-Policy Q-Function Regularization},
  author = {Laixi Shi and Robert Dadashi and Yuejie Chi and Pablo Samuel Castro and Matthieu Geist},
  journal= {arXiv preprint arXiv:2307.13824},
  year   = {2023}
}

备注

Published at European Conference on Machine Learning (ECML), 2023