中文

Q-Pensieve:通过Q快照记忆共享提升多目标强化学习的样本效率

机器学习 2024-07-26 v2

摘要

许多现实世界的连续控制问题处于权衡利弊的困境中,多目标强化学习(MORL)作为针对目标间不同偏好学习控制策略的通用框架。然而,现有MORL方法要么依赖多轮显式搜索寻找帕累托前沿因而样本效率低下,要么使用共享策略网络在策略间进行粗粒度知识共享。为提升MORL的样本效率,我们提出Q-Pensieve,一种存储一组Q快照以联合确定策略更新方向从而支持策略级数据共享的策略改进方案。我们证明Q-Pensieve可自然地与具有收敛保证的软策略迭代相集成。为落实该概念,我们提出Q回放缓冲技术,存储过往迭代中学习到的Q网络,并得出一种实用的actor-critic实现。通过大量实验和消融研究,我们证明所提算法以远少样本即可在各种MORL基准任务上超越基准MORL方法。

关键词

引用

@article{arxiv.2212.03117,
  title  = {Q-Pensieve: Boosting Sample Efficiency of Multi-Objective RL Through Memory Sharing of Q-Snapshots},
  author = {Wei Hung and Bo-Kai Huang and Ping-Chun Hsieh and Xi Liu},
  journal= {arXiv preprint arXiv:2212.03117},
  year   = {2024}
}

备注

20 pages, 15 figures