基于平均奖励准则的逆强化学习
机器学习
2023-05-25 v1 人工智能
摘要
我们研究基于平均奖励准则的逆强化学习(IRL)问题。目标是当智能体仅拥有来自经验智能体的状态与动作样本时,恢复未知策略与奖励函数。以往的 IRL 方法假设专家在折扣环境中训练,且折扣因子已知。本工作通过提出具有高效学习算法的平均奖励框架,缓解了该假设。我们开发了新颖的随机一阶方法来求解平均奖励设定下的 IRL 问题,其需要将平均奖励马尔可夫决策过程(AMDP)作为子问题求解。为求解该子问题,我们开发了适用于一般状态与动作空间的随机策略镜像下降(SPMD)方法,其需要 步梯度计算。借助 SPMD,我们提出逆策略镜像下降(IPMD)方法以求解 IRL 问题,复杂度为 。据我们所知,上述复杂度结果在 IRL 中是新的。最后,我们使用 MuJoCo 基准及额外的控制任务通过数值实验证实我们的分析。
引用
@article{arxiv.2305.14608,
title = {Inverse Reinforcement Learning with the Average Reward Criterion},
author = {Feiyang Wu and Jingyang Ke and Anqi Wu},
journal= {arXiv preprint arXiv:2305.14608},
year = {2023}
}