通过混合启发式方法改进离线强化学习
机器学习
2024-03-19 v2
摘要
我们提出启发式混合(HUBL),一种基于价值自举的广泛离线强化学习(RL)算法的简单性能提升技术。HUBL修改这些算法中使用的贝尔曼算子,将自举价值部分替换为用蒙特卡洛回报估计的启发式价值。对于回报较高的轨迹,HUBL更依赖启发式价值而较少依赖自举;否则,它更 heavily 依赖自举。HUBL非常容易通过用调整后的奖励和折扣因子重新标记离线数据集来与许多现有离线RL实现结合。我们推导出一种理论,将HUBL对离线RL的影响解释为降低离线RL的复杂度,从而提高其有限样本性能。此外,我们实证表明,在D4RL和Meta-World基准的27个数据集上,HUBL一致地将四种最先进的基于自举的离线RL算法(ATAC、CQL、TD3+BC和IQL)的策略质量平均提高了9%。
引用
@article{arxiv.2306.00321,
title = {Improving Offline RL by Blending Heuristics},
author = {Sinong Geng and Aldo Pacchiano and Andrey Kolobov and Ching-An Cheng},
journal= {arXiv preprint arXiv:2306.00321},
year = {2024}
}