中文

在熵正则化强化学习中利用先验解进行奖励塑形与组合

机器学习 2023-01-02 v2

摘要

在强化学习(RL)中,利用已解决任务的先验知识可使智能体快速解决新问题。某些情况下,这些新问题可通过组合已解决的基元任务的解来近似求解(任务组合)。否则,先验知识可用于调整新问题的奖励函数,在保持最优策略不变的同时实现更快学习(奖励塑形)。本工作中,我们为熵正则化 RL 中的奖励塑形与任务组合开发了通用框架。为此,我们推导了两个具有不同奖励函数和动力学的熵正则化 RL 问题的最优软值函数之间的精确关系。我们展示了该推导关系如何导出熵正则化 RL 中奖励塑形的通用结果。随后我们将此方法推广,推导了熵正则化 RL 中多任务组合的最优值函数间的精确关系。我们通过实验验证了这些理论贡献,表明奖励塑形和任务组合在各种设置下均能加速学习。

关键词

引用

@article{arxiv.2212.01174,
  title  = {Utilizing Prior Solutions for Reward Shaping and Composition in Entropy-Regularized Reinforcement Learning},
  author = {Jacob Adamczyk and Argenis Arriojas and Stas Tiomkin and Rahul V. Kulkarni},
  journal= {arXiv preprint arXiv:2212.01174},
  year   = {2023}
}

备注

Conference paper accepted in the Main track for AAAI-2023