中文

基于惩罚动作噪声注入的离线强化学习

机器学习 2025-07-04 v1 人工智能

摘要

离线强化学习(RL)仅使用固定数据集来优化策略,因而在环境交互成本高昂的场景中具有实际应用价值。由于此限制, generalization 能力成为提升离线 RL 算法性能的关键,正如最近基于扩散模型的离线 RL 成功所示。然而, 对于高度性能的离线 RL 算法而言, 扩散模型是否真正必要仍值得质疑, 由于其在推理期间的高计算要求。本文提出了惩罚动作噪声注入(PANI)方法, 该方法仅通过利用注入噪声的动作来覆盖整个动作空间, 同时根据注入噪声的数量进行惩罚。这种方法灵感来自扩散模型在离线 RL 算法中的工作方式。我们为该方法提供了理论基础,表明具有此类注入噪声动作的离线 RL 算法解决的是修改后的马尔可夫决策过程(MDP),我们称为噪声动作 MDP。PANI 与广泛的现有离线 RL 算法兼容,尽管其简单性强,但在各种基准测试中均显示出显著的性能提升。

关键词

引用

@article{arxiv.2507.02356,
  title  = {Offline Reinforcement Learning with Penalized Action Noise Injection},
  author = {JunHyeok Oh and Byung-Jun Lee},
  journal= {arXiv preprint arXiv:2507.02356},
  year   = {2025}
}