中文

基于 SALE 的离线强化学习方法结合集成 Q 网络

机器学习 2025-01-14 v2 人工智能

摘要

本文构建于离线强化学习算法 TD7 之上,该算法集成了状态-动作学习嵌入 (SALE) 以及优先经验回放缓冲区 (LAP)。我们提出一种基于 actor-critic 框架的模型无关方法,融合集成 Q 网络与 EDAC 中的梯度多样性惩罚。集成 Q 网络引入惩罶项,以引导 actor 网络采取分布内动作,从而有效解决超分布动作的挑战。同时,梯度多样性惩罚鼓励 Q 值梯度的多样性,进一步抑制超分布动作的高估。此外,本方法保留可调的行为克隆 (BC) 项,在训练初期引导 actor 网络采纳数据集中的动作,随着 Q 集成精度提升,逐渐减少其影响。这些改进协同工作,提高了训练的稳定性与精度。在 D4RL MuJoCo 基准测试中,实验结果表明,我们的方法在收敛速度、稳定性与性能方面均优于现有方法。

关键词

引用

@article{arxiv.2501.03676,
  title  = {SALE-Based Offline Reinforcement Learning with Ensemble Q-Networks},
  author = {Zheng Chun},
  journal= {arXiv preprint arXiv:2501.03676},
  year   = {2025}
}

备注

19 pages, 7 figures, 4 tables