ODICE:通过正交梯度更新揭示分布校正估计的奥秘
机器学习
2024-02-02 v1 人工智能
摘要
在本研究中,我们研究了分布校正估计(DICE)方法,这是离线强化学习(RL)和模仿学习(IL)中一条重要的研究路线。基于 DICE 的方法施加了状态-动作级别的行为约束,这是离线学习的理想选择。然而,它们的表现通常比当前仅使用动作级别行为约束的最先进(SOTA)方法差得多。在重新审视基于 DICE 的方法后,我们发现使用真实梯度更新学习价值函数时存在两个梯度项:前向梯度(在当前状态上取得)和后向梯度(在下一状态上取得)。使用前向梯度与许多离线 RL 方法有很大的相似性,因此可以被视为应用了动作级别的约束。然而,如果这两个梯度方向冲突,直接添加后向梯度可能会退化或抵消其效果。为了解决这个问题,我们提出了一种简单而有效的修改,即将后向梯度投影到前向梯度的法平面上,从而产生了一种正交梯度更新,这是基于 DICE 方法的一种新学习规则。我们进行了深入的理论分析,发现投影后的后向梯度带来了状态级别的行为正则化,这揭示了基于 DICE 方法的奥秘:价值学习目标确实试图施加状态-动作级别的约束,但需要以校正的方式使用。通过玩具示例以及在复杂的离线 RL 和 IL 任务上的广泛实验,我们证明了使用正交梯度更新的基于 DICE 的方法(O-DICE)实现了 SOTA 性能和极强的鲁棒性。
引用
@article{arxiv.2402.00348,
title = {ODICE: Revealing the Mystery of Distribution Correction Estimation via Orthogonal-gradient Update},
author = {Liyuan Mao and Haoran Xu and Weinan Zhang and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2402.00348},
year = {2024}
}
备注
Spotlight @ ICLR 2024, first two authors contribute equally