中文

强化学习离线数据中的不可行动作惩罚与奖励缩放

机器学习 2025-08-20 v2 人工智能

摘要

使用离线数据的强化学习受到 Q 值外推误差的制约。为此,我们首先展示了线性外推 Q 函数超出数据范围特别具有问题。为缓解这一问题,我们提出引导 Q 值在数据范围之外逐渐减小的做法,这通过层归一化(RS-LN)实现奖励缩放,并通过对不可行动作进行惩罚机制(PA)来实现。将 RS-LN 和 PA 组合,我们开发了一种新算法,称为 PARS。我们在一系列任务上评估了 PARS,表明其在 D4RL 框架下的离线训练和在线微调中均优于最先进的算法,在具有挑战性的 AntMaze Ultra 任务上取得显著成功。

关键词

引用

@article{arxiv.2507.08761,
  title  = {Penalizing Infeasible Actions and Reward Scaling in Reinforcement Learning with Offline Data},
  author = {Jeonghye Kim and Yongjae Shin and Whiyoung Jung and Sunghoon Hong and Deunsol Yoon and Youngchul Sung and Kanghoon Lee and Woohyung Lim},
  journal= {arXiv preprint arXiv:2507.08761},
  year   = {2025}
}

备注

Accepted to ICML2025 (spotlight)