中文

跨域感知奖励函数

人工智能 2017-07-26 v3

摘要

在强化学习中,我们通常通过在期望状态内指定奖励来定义目标。这种方法的一个问题是,每次目标改变时,我们通常需要重新定义奖励,这往往需要对智能体环境中的解决方案有一定理解。当人类学习完成任务时,我们经常利用替代来源来指导我们对问题的理解。此类任务表示允许人们以自己的方式指定目标,从而提供可在各种环境中被恰当解释的规范。这启发了我们自己的工作,其中我们在与智能体不同的环境中表示目标。我们引入了跨域感知奖励(CDPR)函数,这是一种学习到的奖励,表示智能体状态与跨域目标图像之间的视觉相似性。我们报告了使用深度神经网络学习CDPR并将其用于通过深度强化学习解决两个任务的结果。

关键词

引用

@article{arxiv.1705.09045,
  title  = {Cross-Domain Perceptual Reward Functions},
  author = {Ashley D. Edwards and Srijan Sood and Charles L. Isbell},
  journal= {arXiv preprint arXiv:1705.09045},
  year   = {2017}
}

备注

A shorter version of this paper was accepted to RLDM (http://rldm.org/rldm2017/)