中文

IDQL:作为带扩散策略的 Actor-Critic 方法的隐式 Q 学习

机器学习 2023-05-23 v2 人工智能

摘要

有效的离线 RL 方法需要妥善处理分布外动作。隐式 Q 学习(IQL)通过使用修改后的 Bellman 备份仅对数据集动作训练 Q 函数来解决这个问题。然而,目前尚不清楚哪个策略真正达到了这个隐式训练的 Q 函数所表示的值。在本文中,我们通过推广 critic 目标并将其与行为正则化隐式 actor 联系起来,将 IQL 重新解释为 actor-critic 方法。这种推广展示了所诱导的 actor 如何平衡奖励最大化与偏离行为策略的程度,具体的损失选择决定了这种权衡的性质。值得注意的是,该 actor 可表现出复杂和多模态特征,这表明先前方法中使用的带优势加权回归(AWR)的条件高斯 actor 拟合存在问题。相反,我们提出从扩散参数化的行为策略中采样,并利用从 critic 计算的权重对我们的目标策略进行重要性采样。我们引入了隐式扩散 Q 学习(IDQL),将我们通用的 IQL critic 与策略提取方法相结合。IDQL 保持了 IQL 易于实现的优点,同时优于先前的离线 RL 方法,并展示出对超参数的鲁棒性。代码可在 https://github.com/philippe-eecs/IDQL 获取。

关键词

引用

@article{arxiv.2304.10573,
  title  = {IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies},
  author = {Philippe Hansen-Estruch and Ilya Kostrikov and Michael Janner and Jakub Grudzien Kuba and Sergey Levine},
  journal= {arXiv preprint arXiv:2304.10573},
  year   = {2023}
}

备注

9 Pages, 4 Figures, 3 Tables