基于行为熵的离线强化学习数据集生成
机器学习
2025-02-07 v1
摘要
熵基准目标广泛用于强化学习 (RL) 中的状态空间探索以及离线 RL 的数据集生成。行为熵 (BE) 是经典熵的严格推广,包含代理的认知和感知偏差,最近用于离散设置并显示为机器人探索问题的有前景的指标。在本工作中,我们提议将 BE 作为为在复杂、连续的、可能是高维域中系统生成提供多样化状态空间覆盖的数据集的原则探索目标。为此,我们将 BE 扩展到连续设置,推导可计算的 k-最近邻估计器,提供这些估计器的理论保证,并开发可与标准 RL 方法配合使用的实用奖励函数,以学习最大化 BE 的策略。使用标准 MuJoCo 环境,我们在使用 BE、R\\'{e}nyi、Shannon 熵最大化策略收集的数据集上,实验比较了各种下游任务上离线 RL 方法的性能,以及 SMM 和 RND 算法。我们发现,使用 BE 收集的数据集训练的离线 RL 方法在所有任务中都优于使用 Shannon 熵、SMM 和 RND 收集的数据集,BE 收集的数据集在 80% 的任务中也优于使用 R\\'{e}nyi 熵收集的数据集。
引用
@article{arxiv.2502.04141,
title = {Behavioral Entropy-Guided Dataset Generation for Offline Reinforcement Learning},
author = {Wesley A. Suttle and Aamodh Suresh and Carlos Nieto-Granda},
journal= {arXiv preprint arXiv:2502.04141},
year = {2025}
}
备注
Accepted to ICLR 2025