带反向 KL 正则化的 TD3 用于混合数据集的离线强化学习
机器学习
2022-12-06 v1 人工智能
机器学习
摘要
我们考虑一种离线强化学习(RL)设定,其中智能体需从由多个行为策略滚动收集的数据集中学习。该设定面临两个挑战:1)由于不同行为策略导致的动作覆盖差异,优化 RL 信号与行为克隆(BC)信号的最优权衡随状态变化。先前方法仅控制全局权衡,未能处理此问题。2)对给定状态,不同行为策略生成的动作分布可能具有多个模态。许多先前方法中的 BC 正则化子是均值寻求的,导致策略在模态之间选择分布外(OOD)动作。本文中,我们基于 TD3 算法,使用自适应加权的反向 Kullback-Leibler(KL)散度作为 BC 正则化子,以应对这两个挑战。我们的方法不仅以逐状态权重权衡 RL 与 BC 信号(即对动作覆盖窄的状态施以强 BC 正则化,反之亦然),还因反向 KL 的模态寻求特性而避免选择 OOD 动作。实证上,在标准 D4RL 数据集以及合并标准数据集所得的混合数据集上的 MuJoCo 运动任务中,我们的算法优于现有离线 RL 算法。
引用
@article{arxiv.2212.02125,
title = {TD3 with Reverse KL Regularizer for Offline Reinforcement Learning from Mixed Datasets},
author = {Yuanying Cai and Chuheng Zhang and Li Zhao and Wei Shen and Xuyun Zhang and Lei Song and Jiang Bian and Tao Qin and Tieyan Liu},
journal= {arXiv preprint arXiv:2212.02125},
year = {2022}
}
备注
Accepted by ICDM-22 (Best Student Paper Runner-Up Awards)