中文

基于多等级专家的逆强化学习

机器学习 2019-08-01 v1 机器学习

摘要

我们考虑在马尔可夫决策过程中当奖励函数未指定、但可获取一组表现各异的示范者时,学习最优行为的问题。我们假设示范者被分类为k个等级之一,并利用序数回归的思想寻找一个最大化不同等级间间隔的奖励函数。该方法基于如下理念:智能体不仅应从专家学习如何行为,也应从非专家学习如何不行为。我们表明,存在一些MDP,其中奖励函数的重要差异会被专家的行为对现有算法隐藏。我们的方法对于可获取大量具有不同专业程度的智能体行为(例如通过GPS或手机)的问题尤为有用。我们使用一个简单的网格域凸显本方法与现有方法的差异,并利用大型GPS轨迹数据集展示了其在确定出租车司机寻客策略上的有效性。

关键词

引用

@article{arxiv.1907.13411,
  title  = {Inverse Reinforcement Learning with Multiple Ranked Experts},
  author = {Pablo Samuel Castro and Shijian Li and Daqing Zhang},
  journal= {arXiv preprint arXiv:1907.13411},
  year   = {2019}
}