中文

一种高效、广义的协作式逆强化学习贝尔曼更新

人工智能 2018-06-12 v1

摘要

我们的目标是让 AI 系统正确识别并依据其人类用户的客观目标行动。协作式逆强化学习 (Cooperative Inverse Reinforcement Learning, CIRL) 将这一价值对齐问题形式化为人类与机器人之间的双人博弈,其中仅有人类知晓奖励函数的参数:机器人需要在交互展开过程中学习这些参数。先前的研究表明 CIRL 可作为一个 POMDP 求解,但其动作空间大小在奖励参数空间大小上呈指数级。在本工作中,我们利用 CIRL 的一个特定性质——人类是一个完全信息智能体——推导出一种保持最优性的标准贝尔曼更新修正;这将问题的复杂度降低了指数级因子,并使我们能够放宽 CIRL 关于人类理性的假设。我们将此更新应用于多种 POMDP 求解器,发现它使我们能够将 CIRL 扩展到非平凡问题,具有更大的奖励参数空间,以及机器人和人类更大的动作空间。在这些较大问题的解中,人类表现出教学 (pedagogic) 行为,而机器人将其如此解读并为人类获得更高价值。

关键词

引用

@article{arxiv.1806.03820,
  title  = {An Efficient, Generalized Bellman Update For Cooperative Inverse Reinforcement Learning},
  author = {Dhruv Malik and Malayandi Palaniappan and Jaime F. Fisac and Dylan Hadfield-Menell and Stuart Russell and Anca D. Dragan},
  journal= {arXiv preprint arXiv:1806.03820},
  year   = {2018}
}