中文

基于平均奖励准则的逆强化学习

机器学习 2023-05-25 v1 人工智能

摘要

我们研究基于平均奖励准则的逆强化学习(IRL)问题。目标是当智能体仅拥有来自经验智能体的状态与动作样本时,恢复未知策略与奖励函数。以往的 IRL 方法假设专家在折扣环境中训练,且折扣因子已知。本工作通过提出具有高效学习算法的平均奖励框架,缓解了该假设。我们开发了新颖的随机一阶方法来求解平均奖励设定下的 IRL 问题,其需要将平均奖励马尔可夫决策过程(AMDP)作为子问题求解。为求解该子问题,我们开发了适用于一般状态与动作空间的随机策略镜像下降(SPMD)方法,其需要 O(1/ε)\mathcal{{O}}(1/\varepsilon) 步梯度计算。借助 SPMD,我们提出逆策略镜像下降(IPMD)方法以求解 IRL 问题,复杂度为 O(1/ε2)\mathcal{O}(1/\varepsilon^2)。据我们所知,上述复杂度结果在 IRL 中是新的。最后,我们使用 MuJoCo 基准及额外的控制任务通过数值实验证实我们的分析。

关键词

引用

@article{arxiv.2305.14608,
  title  = {Inverse Reinforcement Learning with the Average Reward Criterion},
  author = {Feiyang Wu and Jingyang Ke and Anqi Wu},
  journal= {arXiv preprint arXiv:2305.14608},
  year   = {2023}
}