中文

基于人机示教知识动态复用的交互式强化学习

人工智能 2018-05-14 v1

摘要

近年来强化学习取得了诸多成功。然而,这些成功通常需要在智能体达到可接受性能之前使用非常大量的数据。本文提出一种利用已有(人类或智能体)知识来应对这一需求的新方法。具体而言,本文使用来自智能体和人类的示教,使未经训练的智能体能够快速达到高性能。我们通过实证比较并指出了 HAT 和 CHAT(从源智能体/人类向目标智能体迁移知识的方法)的不足。本文提出一种有效的迁移方法 DRoP,将离线知识(学习前记录的示教)与基于在线置信度的性能分析相结合。DRoP 动态引入示教者的知识,将其整合进强化学习智能体的在线学习回路,以实现高效且鲁棒的学习。

关键词

引用

@article{arxiv.1805.04493,
  title  = {Interactive Reinforcement Learning with Dynamic Reuse of Prior Knowledge from Human/Agent's Demonstration},
  author = {Zhaodong Wang and Matthew E. Taylor},
  journal= {arXiv preprint arXiv:1805.04493},
  year   = {2018}
}