中文

借助人类辅助改进强化学习:基于HIPPO Gym的人类被试研究论证

机器学习 2021-02-05 v1 人工智能 人机交互

摘要

强化学习(RL)是一种流行的机器学习范式,用于游戏博弈、机器人控制及其他序贯决策任务。然而,RL智能体常因从随机行动开始而具有较长的学习时间与较高的数据需求。为了在复杂任务中更好地学习,本文论证外部教师往往能显著帮助RL智能体学习。OpenAI Gym是RL研究的常用框架,包含大量标准环境与智能体,显著降低了RL研究门槛。本文介绍我们新的开源RL框架——面向OpenAI Gym的人类输入解析平台(Human Input Parsing Platform for Openai Gym, HIPPO Gym),及其创建过程中的设计决策。该平台旨在促进人类-RL研究,再次降低门槛以使更多研究者能快速探究人类教师辅助RL智能体的不同方式,包括从演示中学习、从反馈中学习或课程学习。

关键词

引用

@article{arxiv.2102.02639,
  title  = {Improving Reinforcement Learning with Human Assistance: An Argument for Human Subject Studies with HIPPO Gym},
  author = {Matthew E. Taylor and Nicholas Nissen and Yuan Wang and Neda Navidi},
  journal= {arXiv preprint arXiv:2102.02639},
  year   = {2021}
}