基于不确定性的离线强化学习中策略约束与集成规模的平衡
机器学习
2023-03-28 v1
摘要
离线强化学习智能体从固定数据集中寻求最优策略。由于禁止与环境交互,智能体在防止价值估计误差累积并随后导致学习过程崩溃方面面临重大挑战。使用集成的不确定性估计通过对高方差价值估计施加惩罚来补偿这一点,使智能体能够基于数据驱动的动作学习鲁棒策略。然而,为促进充分惩罚而对大型集成的需求导致了显著的计算开销。在本工作中,我们考察策略约束作为调节不确定性的机制的作用,以及约束水平与集成规模之间的相应平衡。通过将行为克隆纳入策略更新,我们经验性地表明,可用小得多的集成规模实现充分惩罚,在保留基准任务上最先进性能的同时大幅降低计算需求。此外,我们展示了这种方法如何能够促进稳定的在线微调,从而在避免严重性能下降的同时实现策略的持续改进。
引用
@article{arxiv.2303.14716,
title = {Balancing policy constraint and ensemble size in uncertainty-based offline reinforcement learning},
author = {Alex Beeson and Giovanni Montana},
journal= {arXiv preprint arXiv:2303.14716},
year = {2023}
}