中文

面向离线强化学习的行为克隆演员-评论家的近端动作替换

机器学习 2026-05-15 v2 人工智能

摘要

离线强化学习(RL)通过优化使用先前收集的静态数据集来实现策略优化,是RL的一个重要分支。一种流行且有前景的方法是使用行为克隆(BC)对演员-评论家方法进行正则化,该方法能够快速生成 realistic的策略,并缓解来自超出分布动作的偏差,但可能会导致常被忽视的性能瓶颈:当数据集中的动作次优时,无条件模仿会结构性地阻止演员充分利用由价值函数所建议的更好动作,尤其是在后期训练阶段,当模仿已占主导时。我们通过研究BC正则化的演员-评论家优化的收敛性质,对这一限制进行了形式化分析,并在受控的连续bandit任务中验证了其存在。为突破这一瓶颈,我们提出近端动作替换(PAR),这是一种易于使用的即插即用训练样本替换方法。PAR用由稳定目标策略生成的更好动作取代数据集中的次优动作,该目标由动作价值函数的局部上升方向引导,并受价值不确定性的限制以确保训练稳定性。PAR兼容多种BC正则化范例。广泛的离线RL基准实验表明,PAR在性能上始终具有优势,仅通过与基本TD3+BC组合即可达到最新成绩。

关键词

引用

@article{arxiv.2602.07441,
  title  = {Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning},
  author = {Jinzong Dong and Wei Huang and Jianshu Zhang and Zhuo Chen and Xinzhe Yuan and Qinying Gu and Zhaohui Jiang and Nanyang Ye},
  journal= {arXiv preprint arXiv:2602.07441},
  year   = {2026}
}