反事实经验增强的无策略强化学习
机器学习
2025-03-19 v1 人工智能
机器学习
摘要
强化学习控制算法面临显著的分布外和低效探索问题。虽然基于模型的强化学习通过构建虚拟环境来增强智能体的推理和规划能力,但构建虚拟环境的过程可能非常复杂。为构建高效推断模型并增强学习数据的代表性,本文提出了反事实经验增强(CEA)算法。CEA利用变分自编码器建模状态转移模式,并引入随机性以建模非平稳性。该方法通过反事实推断扩展经验池中的学习数据,在遵循双平衡假设的环境中表现卓越。双平衡性质的环境通常具有离散观察和动作空间,我们提出一种基于最大核密度估计熵的抽样方法,将CEA扩展到各种环境。通过基于真实信息为反事实状态转移提供奖励信号,CEA构建完整的反事实经验,以缓解学习数据的分布外问题,在具有差异特性的环境中超越通用SOTA算法。最后,我们讨论了生成的反事实经验与真实经验的相似性、差异性及其属性。代码已公开于https://github.com/Aegis1863/CEA。
引用
@article{arxiv.2503.13842,
title = {Counterfactual experience augmented off-policy reinforcement learning},
author = {Sunbowen Lee and Yicheng Gong and Chao Deng},
journal= {arXiv preprint arXiv:2503.13842},
year = {2025}
}
备注
Accepted by Neurocomputing, https://doi.org/10.1016/j.neucom.2025.130017