中文

离线强化学习的价值学习是否真正是主要瓶颈?

机器学习 2024-10-30 v2 人工智能

摘要

虽然仿射学习需要获取高质量数据,但离线强化学习(RL)本应在原则上能够使用显著降低的数据质量即可实现与其相似或更好的性能,因为它依赖价值函数。然而,当前结果表明离线强化学习往往表现不如仿射学习,且对离线强化学习性能的限制因素常常不清晰。为了理解当前离线强化学习算法中的瓶颈,我们对(1)价值学习、(2)策略提取和(3)离线强化学习中的策略泛化进行了系统实证研究,分析了这些组件如何影响性能。我们做出了两个令人惊讶的发现。首先,我们发现策略提取算法的选择对离线强化学习的性能和可扩展性影响往往大于价值学习目标。例如,我们表明常见的价值加权行为克隆目标(如AWR)未能充分利用所学习的价值函数,而改用基于行为约束的策略梯度目标(如DDPG+BC)常常会导致性能和可扩展性的显著提升。其次,我们发现提高离线强化学习性能的主要障碍往往是策略在测试时间对训练数据支持范围之外状态的泛化不完美,而不是在分布内状态上的策略学习。我们随后表明,使用次优但覆盖面更广的数据或测试时间策略训练技术可在实践中解决此泛化问题。具体地,我们提出了两种简单的方法,可在测试时间改进策略,并表明这些方法带来了更好的性能。

关键词

引用

@article{arxiv.2406.09329,
  title  = {Is Value Learning Really the Main Bottleneck in Offline RL?},
  author = {Seohong Park and Kevin Frans and Sergey Levine and Aviral Kumar},
  journal= {arXiv preprint arXiv:2406.09329},
  year   = {2024}
}

备注

NeurIPS 2024