中文

CWAE-IRL:将逆强化学习问题表述为一种监督方法

机器学习 2019-10-03 v1 人工智能 机器学习

摘要

逆强化学习(IRL)用于从运行马尔可夫决策过程(MDP)的专家动作中推断奖励函数。本研究提出了一种使用变分推断学习奖励函数的新方法。利用该技术,连续潜变量(此处为奖励函数)的难处理后验分布被解析地近似,使其在试图基于当前状态与动作重构未来状态时,尽可能接近先验信念。奖励函数使用一种称为条件变分自编码器(CVAE)并结合 Wasserstein 损失函数的著名深度生成模型推导,因此被称为条件 Wasserstein 自编码器-IRL(CWAE-IRL),它可被视为后向推断与前向推断的结合。这可以在不了解智能体系统动力学的情况下,形成对先前 IRL 方法的一种高效替代。在 objectworld 和 pendulum 等标准基准上的实验结果表明,所提算法能够在复杂、高维环境中有效学习潜奖励函数。

关键词

引用

@article{arxiv.1910.00584,
  title  = {CWAE-IRL: Formulating a supervised approach to Inverse Reinforcement Learning problem},
  author = {Arpan Kusari},
  journal= {arXiv preprint arXiv:1910.00584},
  year   = {2019}
}