中文

面向最优保守离线强化学习的重要性加权 Actor-Critic

机器学习 2023-10-10 v2

摘要

我们提出了 A-Crab(由平均 Bellman 误差正则化的 Actor-Critic),一种用于数据覆盖不足复杂环境下离线强化学习(RL)的新实用算法。我们的算法将边缘化重要性采样框架与 actor-critic 范式相结合,其中 critic 返回对 actor(策略)的评估,这些评估相对于离线数据是悲观的,并且具有较小的平均(重要性加权)Bellman 误差。与现有方法相比,我们的算法同时具有以下优势:(1)即使在结合通用函数逼近器时,它也能在收敛到离线数据集中所覆盖的最佳策略时达到 1/N1/\sqrt{N} 的最优统计速率——其中 NN 为离线数据集的大小。(2)它依赖于较弱的策略覆盖平均概念(相较于 \ell_\infty 单策略可集中性),利用了策略访问的结构。(3)它在广泛的特定超参数范围内优于数据收集行为策略。我们提供了理论分析和实验结果来验证所提算法的有效性。

关键词

引用

@article{arxiv.2301.12714,
  title  = {Importance Weighted Actor-Critic for Optimal Conservative Offline Reinforcement Learning},
  author = {Hanlin Zhu and Paria Rashidinejad and Jiantao Jiao},
  journal= {arXiv preprint arXiv:2301.12714},
  year   = {2023}
}

备注

24 pages, 3 figures