提升强化学习数据效率:一种基于网格信息传播的新颖想象机制
机器学习
2023-09-28 v2 人工智能
摘要
强化学习(RL)算法面临数据效率有限的挑战,尤其在处理高维状态空间与大规模问题时。大多数RL方法在更新智能体的Critic时仅依赖同一回合内的状态转移信息,这会导致数据效率低下与次优的训练时间消耗。受类人类比推理能力启发,我们引入一种称为“想象机制(Imagination Mechanism, IM)”的新颖网格信息传播机制,旨在显著提升RL算法的数据效率。具体而言,IM使单个样本生成的信息能有效广播至不同回合中的不同状态,而非仅在同一回合内传递。该能力增强了模型对状态间相互依赖的理解,并促进对有限样本信息更高效的学习。为提升通用性,我们将IM扩展为即插即用模块,可无缝流畅地集成到其他广泛采用的RL算法中。我们的实验表明,IM持续以可观幅度提升SAC、PPO、DDPG和DQN等四种主流SOTA RL算法,最终在各种任务上取得优于之前的性能。代码与数据请访问 https://github.com/OuAzusaKou/imagination_mechanism
引用
@article{arxiv.2309.14243,
title = {Enhancing data efficiency in reinforcement learning: a novel imagination mechanism based on mesh information propagation},
author = {Zihang Wang and Maowei Jiang},
journal= {arXiv preprint arXiv:2309.14243},
year = {2023}
}
备注
10 pages. arXiv admin note: text overlap with arXiv:2007.05929 by other authors