中文

FRESH:利用人类反馈在高维状态空间中进行交互式奖励塑形

人工智能 2020-01-22 v1

摘要

强化学习已成功训练自主智能体在复杂环境中达成目标。尽管其已适配包括机器人与电脑游戏在内的多种场景,人类玩家在某些环境中往往比强化学习算法更易获得更高奖励。这在智能体所获奖励稀疏或极度延迟的高维状态空间中尤为明显。本文中,我们致力于将人类操作员提供的反馈信号与高维状态空间中的深度强化学习算法有效融合。我们称之为 FRESH(基于反馈的奖励塑形,Feedback-based REward SHaping)。训练期间,人类操作员观看来自回放缓冲区的轨迹,并对轨迹中的状态与动作给出反馈。为将人类操作员提供的反馈信号泛化至测试时未曾见过的状态与动作,我们使用一个反馈神经网络。我们采用具有共享网络架构的神经网络集成来表示模型不确定性及神经网络对其输出的置信度。反馈神经网络的输出被转换为塑形奖励,并与环境所提供的奖励相叠加。我们在街机学习环境中的 Bowling 与 Skiing 雅达利游戏上评估了我们的方法。尽管人类专家能在这些环境中取得高分,最先进的深度学习算法表现糟糕。我们观察到 FRESH 在两种环境中均能取得远高于最先进深度学习算法的分数。FRESH 在 Bowling 中还比人类专家高出 21.4% 的分数,并在 Skiing 中与人类专家表现相当。

关键词

引用

@article{arxiv.2001.06781,
  title  = {FRESH: Interactive Reward Shaping in High-Dimensional State Spaces using Human Feedback},
  author = {Baicen Xiao and Qifan Lu and Bhaskar Ramasubramanian and Andrew Clark and Linda Bushnell and Radha Poovendran},
  journal= {arXiv preprint arXiv:2001.06781},
  year   = {2020}
}

备注

Accepted as Full Paper to International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS) 2020