中文

CoachNet:一种用于强化学习的对抗式采样方法

机器学习 2021-01-08 v1 机器人学

摘要

尽管强化学习在游戏与机器人领域近期取得进展,其尚待广泛实用。样本效率低下以及在罕见但具挑战性场景中的不可靠表现是两个主要障碍。受刻意练习可达专家级人类表现之效的启发,我们提出一种由名为“CoachNet”的失败预测器引导的新型对抗式采样方法。CoachNet 与智能体在线联合训练以预测失败概率。该概率随后用于随机采样过程,将智能体引导至更具挑战性的回合。如此,训练聚焦于智能体的“薄弱点”,而非在已掌握场景中浪费时间。我们给出 CoachNet 的设计、阐释其基本原理,并实证展示其在提升常见连续控制任务中样本效率与测试时鲁棒性方面的有效性。

关键词

引用

@article{arxiv.2101.02649,
  title  = {CoachNet: An Adversarial Sampling Approach for Reinforcement Learning},
  author = {Elmira Amirloo Abolfathi and Jun Luo and Peyman Yadmellat and Kasra Rezaee},
  journal= {arXiv preprint arXiv:2101.02649},
  year   = {2021}
}

备注

NeurIPS2019 Workshop on Safety and Robustness in Decision Making