IDQL:作为带扩散策略的 Actor-Critic 方法的隐式 Q 学习
机器学习
2023-05-23 v2 人工智能
摘要
有效的离线 RL 方法需要妥善处理分布外动作。隐式 Q 学习(IQL)通过使用修改后的 Bellman 备份仅对数据集动作训练 Q 函数来解决这个问题。然而,目前尚不清楚哪个策略真正达到了这个隐式训练的 Q 函数所表示的值。在本文中,我们通过推广 critic 目标并将其与行为正则化隐式 actor 联系起来,将 IQL 重新解释为 actor-critic 方法。这种推广展示了所诱导的 actor 如何平衡奖励最大化与偏离行为策略的程度,具体的损失选择决定了这种权衡的性质。值得注意的是,该 actor 可表现出复杂和多模态特征,这表明先前方法中使用的带优势加权回归(AWR)的条件高斯 actor 拟合存在问题。相反,我们提出从扩散参数化的行为策略中采样,并利用从 critic 计算的权重对我们的目标策略进行重要性采样。我们引入了隐式扩散 Q 学习(IDQL),将我们通用的 IQL critic 与策略提取方法相结合。IDQL 保持了 IQL 易于实现的优点,同时优于先前的离线 RL 方法,并展示出对超参数的鲁棒性。代码可在 https://github.com/philippe-eecs/IDQL 获取。
引用
@article{arxiv.2304.10573,
title = {IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies},
author = {Philippe Hansen-Estruch and Ilya Kostrikov and Michael Janner and Jakub Grudzien Kuba and Sergey Levine},
journal= {arXiv preprint arXiv:2304.10573},
year = {2023}
}
备注
9 Pages, 4 Figures, 3 Tables