面向离线强化学习的排他性惩罚 Q 学习
机器学习
2024-10-25 v2 人工智能
摘要
基于约束的离线强化学习(RL)涉及策略约束或对价值函数施加惩罚,以缓解分布迁移导致的估计偏差。本文关注现有离线 RL 方法中基于惩罚价值函数的局限性,指出因在价值函数中引入不必要的偏差而可能导致估计偏差。为解决此问题,我们提出排他性惩罚 Q 学习(EPQ),通过对易诱导估计误差的状态进行选择性惩罚来降低价值函数的估计偏差。数值结果表明,我们的方法在 various offline control 任务中显著降低了估计偏差并提升了性能。
引用
@article{arxiv.2405.14082,
title = {Exclusively Penalized Q-learning for Offline Reinforcement Learning},
author = {Junghyuk Yeom and Yonghyeon Jo and Jungmo Kim and Sanghyeon Lee and Seungyul Han},
journal= {arXiv preprint arXiv:2405.14082},
year = {2024}
}
备注
10 technical page followed by references and appendix. Accepted to Neurips 2024 as spotlight paper