隐含于世界状态中的偏好
机器学习
2019-04-22 v2 人工智能
机器学习
摘要
强化学习(RL)智能体仅优化奖励函数中所指定的特征,而对无意中遗漏的任何内容漠不关心。这意味着我们不仅必须指定要做什么,还必须指定大得多的“不该做什么”的空间。我们很容易忘记这些偏好,因为这些偏好在我们的环境中已经得到满足。这引出了我们的核心见解:当机器人在人类活动的环境中部署时,环境的状态已经针对人类的需求进行了优化。因此,我们可以利用来自状态的这种隐式偏好信息来填补空白。我们开发了一种基于最大因果熵逆强化学习(IRL)的算法,并在一套旨在展示其性质的概念验证环境中对该想法进行了评估。我们发现,来自初始状态的信息可用于推断应避免的副作用以及对环境应如何组织的偏好。我们的代码可在 https://github.com/HumanCompatibleAI/rlsp 找到。
引用
@article{arxiv.1902.04198,
title = {Preferences Implicit in the State of the World},
author = {Rohin Shah and Dmitrii Krasheninnikov and Jordan Alexander and Pieter Abbeel and Anca Dragan},
journal= {arXiv preprint arXiv:1902.04198},
year = {2019}
}
备注
Published at ICLR 2019