SelfBC:基于离线强化学习的自行为克隆
机器学习
2024-08-06 v1 人工智能
摘要
离线强化学习中的策略约束方法采用额外的正则化技术来约束所学习策略与离线数据集之间的差异。然而,这些方法倾向于产生过于保守的策略,使其类似于行为策略,从而限制了其性能。我们研究了这一局限性,并将其归因于传统约束的静态性质。本文提出了一种新型的动态策略约束,该约束限制了由先前学习策略的指数移动平均生成的样本上的所学策略。通过将这种自约束机制集成到基于离议的方法中,我们的方法促进了在离线环境下学习非保守策略的能力,同时避免了策略崩溃。理论结果表明,我们的方法可实现近乎单调递增的参考策略。大量在 D4RL MuJoCo 域上的实验表明,我们提出的方法在策略约束方法中实现了最先进的性能。
引用
@article{arxiv.2408.02165,
title = {SelfBC: Self Behavior Cloning for Offline Reinforcement Learning},
author = {Shirong Liu and Chenjia Bai and Zixian Guo and Hao Zhang and Gaurav Sharma and Yang Liu},
journal= {arXiv preprint arXiv:2408.02165},
year = {2024}
}