极限 Q 学习:无熵的最大熵强化学习
机器学习
2023-03-02 v2 人工智能
机器人学
摘要
现代深度强化学习(RL)算法需要最大 Q 值的估计,而在具有无限可能动作的连续域中这难以计算。本工作中,我们引入一种用于在线与离线 RL 的新更新规则,其借助受经济学启发的极值理论(EVT)直接对最大值建模。由此,我们避免了使用分布外动作计算 Q 值,而后者常是误差的重要来源。我们的核心见解是引入一个目标,直接在最大熵 RL 设定下估计最优软值函数(LogSumExp),无需从策略中采样。利用 EVT,我们推导出我们的极限 Q 学习(Extreme Q-Learning)框架,并由此得到在线以及——首次实现的——离线 MaxEnt Q 学习算法,它们无需显式访问策略或其熵。我们的方法在 D4RL 基准上取得持续强劲表现,在具挑战的 Franka Kitchen 任务上以 10+ 点超越先前工作,同时在在线 DM Control 任务上较 SAC 与 TD3 有适度提升。可视化与代码见我们的网站 https://div99.github.io/XQL/。
引用
@article{arxiv.2301.02328,
title = {Extreme Q-Learning: MaxEnt RL without Entropy},
author = {Divyansh Garg and Joey Hejna and Matthieu Geist and Stefano Ermon},
journal= {arXiv preprint arXiv:2301.02328},
year = {2023}
}
备注
ICLR 2023 Oral