中文

面向动作条件自预测强化学习的统一框架

机器学习 2024-06-05 v1 人工智能

摘要

学习良好的表征是强化学习 (RL) 智能体面临的关键挑战。自预测学习通过从未来潜在表征上引导学习,提供了联合学习潜在表征和动态模型的途径。最近的研究通过研究自预测表征学习的连续时间 ODE 模型,为这些算法提供了理论见解,假设算法依赖于固定策略 (BYOL-Π\Pi);这一假设与实际算法实例相矛盾——这些算法会明确地将未来动作纳入其预测条件中。本文致力于弥合理论与实践之间的鸿沟,通过使用 ODE 框架分析动作条件自预测目标 (BYOL-AC),刻画其收敛性质,并突出 BYOL-Π\Pi 与 BYOL-AC 动力学极限解之间的重要区别。我们展示了两种表征之间存在关联的方差方程。该联系导致了一种新型类似方差的动作条件目标 (BYOL-VAR) 及其对应的 ODE。我们通过两个互补的视角统一研究这三个目标:模型基视角下,每个目标均 shown 等价于某些动态的低秩近似;模型无视角下,建立了目标与其各自价值、Q 值和优势函数之间的关系。我们的实证研究涵盖了线性函数逼近和深度 RL 环境,结果表明 BYOL-AC 在各种不同设置下总体表现更佳。

关键词

引用

@article{arxiv.2406.02035,
  title  = {A Unifying Framework for Action-Conditional Self-Predictive Reinforcement Learning},
  author = {Khimya Khetarpal and Zhaohan Daniel Guo and Bernardo Avila Pires and Yunhao Tang and Clare Lyle and Mark Rowland and Nicolas Heess and Diana Borsa and Arthur Guez and Will Dabney},
  journal= {arXiv preprint arXiv:2406.02035},
  year   = {2024}
}