优先轨迹回放:一种用于数据驱动强化学习的回放记忆
机器学习
2025-03-24 v2 人工智能
摘要
近年来,数据驱动强化学习(RL),亦称离线 RL,受到显著关注。然而,尽管数据采样技术有提升在线 RL 性能的潜力,其在离线 RL 中的作用却被忽视。近期研究表明,将采样技术直接应用于状态转移并不能在离线 RL 中稳定地改善性能。因此,在本研究中,我们提出一种记忆技术——(优先)轨迹回放(TR/PTR),将采样视角扩展至轨迹,以从有限数据中更全面地提取信息。TR 通过对轨迹进行反向采样优化后续状态信息的使用,从而提升学习效率。在 TR 基础上,我们构建加权评论家目标以避免离线训练中采样到未见动作,以及优先轨迹回放(PTR),其通过多种轨迹优先级度量实现更高效的轨迹采样。我们在 D4RL 上展示了将 TR 和 PTR 与现有离线 RL 算法集成的益处。总之,我们的研究强调了基于轨迹的数据采样技术在提升离线 RL 算法效率与性能方面的重要性。
引用
@article{arxiv.2306.15503,
title = {Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning},
author = {Jinyi Liu and Yi Ma and Jianye Hao and Yujing Hu and Yan Zheng and Tangjie Lv and Changjie Fan},
journal= {arXiv preprint arXiv:2306.15503},
year = {2025}
}
备注
Accepted by AAMAS 2024, see https://dl.acm.org/doi/10.5555/3635637.3662980