面向最优保守离线强化学习的重要性加权 Actor-Critic
机器学习
2023-10-10 v2
摘要
我们提出了 A-Crab(由平均 Bellman 误差正则化的 Actor-Critic),一种用于数据覆盖不足复杂环境下离线强化学习(RL)的新实用算法。我们的算法将边缘化重要性采样框架与 actor-critic 范式相结合,其中 critic 返回对 actor(策略)的评估,这些评估相对于离线数据是悲观的,并且具有较小的平均(重要性加权)Bellman 误差。与现有方法相比,我们的算法同时具有以下优势:(1)即使在结合通用函数逼近器时,它也能在收敛到离线数据集中所覆盖的最佳策略时达到 的最优统计速率——其中 为离线数据集的大小。(2)它依赖于较弱的策略覆盖平均概念(相较于 单策略可集中性),利用了策略访问的结构。(3)它在广泛的特定超参数范围内优于数据收集行为策略。我们提供了理论分析和实验结果来验证所提算法的有效性。
引用
@article{arxiv.2301.12714,
title = {Importance Weighted Actor-Critic for Optimal Conservative Offline Reinforcement Learning},
author = {Hanlin Zhu and Paria Rashidinejad and Jiantao Jiao},
journal= {arXiv preprint arXiv:2301.12714},
year = {2023}
}
备注
24 pages, 3 figures