中文

基于 KL 散度的正则化最优经验回放

机器学习 2024-09-20 v1 人工智能 机器人学

摘要

经验回放是在线强化学习成功中的关键组件。优先级经验回放 (PER) 通过时序差分 (TD) 误差对经验进行重权,从而实证提升性能。然而,鲜有研究探讨使用 TD 误差的动机。本文提供了一种关于基于 TD 误差的重加权的替代视角。我们展示了经验优先级与占有率优化之间的联系。通过使用带有 ff-散度 正则化的正则化 RL 目标,并运用其对偶形式,我们显示,目标的最优解是通过将回放缓冲区中离策略数据的分布向于在策略最优分布的 TD-误差基准的占有率比例进行迁移获得的。我们的推导结果导致了一条新的 TD 误差优先级管道。我们特别探索了 KL 散度作为正则化器,获得了新的优先级方案,即正则化最优经验回放 (ROER)。我们在连续控制 MuJoCo 和 DM Control 基准任务中评估了所提出的优先级方案,该方案基于 Soft Actor-Critic (SAC) 算法,其中我们的方法在 6 个任务中超越基线,而其余任务的结果与基线相当或不远离基线。进一步地,通过使用预训练,ROER 在较具挑战性的 Antmaze 环境中实现了显著性的改进,其中基线方法失败,显示其在离线到在线微调中的适用性。代码可在 \url{https://github.com/XavierChanglingLi/Regularized-Optimal-Experience-Replay} 获取。

关键词

引用

@article{arxiv.2407.03995,
  title  = {ROER: Regularized Optimal Experience Replay},
  author = {Changling Li and Zhang-Wei Hong and Pulkit Agrawal and Divyansh Garg and Joni Pajarinen},
  journal= {arXiv preprint arXiv:2407.03995},
  year   = {2024}
}