中文

融合多技能人类反馈的强化学习

机器学习 2021-11-17 v1

摘要

一种有望提升强化学习鲁棒性与探索能力的方法是收集人类反馈,从而将目标环境的先验知识纳入其中。然而,获取足够数量的优质反馈往往代价过高。为缓解该问题,我们旨在依靠一组具有不同技能水平的多名专家(及非专家)来产生充足反馈。此类反馈因此可能不一致且稀疏。本文在先前工作——Advise,一种试图最大化人类反馈信息增益的贝叶斯方法——基础上,扩展该算法以接受来自这一更大群体(训练者)的反馈,同时估计每位训练者的可靠性。我们展示了聚合多名训练者的反馈如何提高总体反馈准确性,并从两方面简化收集过程。首先,该方法处理了部分训练者具有对抗性的情形。其次,获取每位训练者可靠性的信息提供了第二层鲁棒性,并为管理系统整体的人员提供了有价值的信息以增进对系统的总体信任。它提供了一种可操作的工具,用于在需要时改进反馈收集过程或修改奖励函数设计。我们通过实验表明,即便部分来源具有对抗性,我们的方法也能准确学习每位训练者的可靠性,并利用其最大化来自多名训练者反馈的信息增益。

关键词

引用

@article{arxiv.2111.08596,
  title  = {Reinforcement Learning with Feedback from Multiple Humans with Diverse Skills},
  author = {Taku Yamagata and Ryan McConville and Raul Santos-Rodriguez},
  journal= {arXiv preprint arXiv:2111.08596},
  year   = {2021}
}

备注

Accepted NeurIPS 2021 Workshop on Safe and Robust Control of Uncertain Systems. arXiv admin note: text overlap with arXiv:1908.06134