中文

提升强化学习数据效率:一种基于网格信息传播的新颖想象机制

机器学习 2023-09-28 v2 人工智能

摘要

强化学习(RL)算法面临数据效率有限的挑战,尤其在处理高维状态空间与大规模问题时。大多数RL方法在更新智能体的Critic时仅依赖同一回合内的状态转移信息,这会导致数据效率低下与次优的训练时间消耗。受类人类比推理能力启发,我们引入一种称为“想象机制(Imagination Mechanism, IM)”的新颖网格信息传播机制,旨在显著提升RL算法的数据效率。具体而言,IM使单个样本生成的信息能有效广播至不同回合中的不同状态,而非仅在同一回合内传递。该能力增强了模型对状态间相互依赖的理解,并促进对有限样本信息更高效的学习。为提升通用性,我们将IM扩展为即插即用模块,可无缝流畅地集成到其他广泛采用的RL算法中。我们的实验表明,IM持续以可观幅度提升SAC、PPO、DDPG和DQN等四种主流SOTA RL算法,最终在各种任务上取得优于之前的性能。代码与数据请访问 https://github.com/OuAzusaKou/imagination_mechanism

关键词

引用

@article{arxiv.2309.14243,
  title  = {Enhancing data efficiency in reinforcement learning: a novel imagination mechanism based on mesh information propagation},
  author = {Zihang Wang and Maowei Jiang},
  journal= {arXiv preprint arXiv:2309.14243},
  year   = {2023}
}

备注

10 pages. arXiv admin note: text overlap with arXiv:2007.05929 by other authors