中文

使用弱监督的策略学习

机器学习 2021-11-03 v3 人工智能 机器学习

摘要

大多数现有策略学习方案要求学习智能体接收高质量监督信号,例如强化学习(RL)中精心设计的奖励或行为克隆(BC)中的高质量专家示范。这些高质量监督在实践中通常难以获得或成本高昂。我们旨在构建一个统一框架,利用可用的廉价弱监督高效执行策略学习。为处理该问题,我们将“弱监督”视为来自同伴智能体的不完美信息,并基于与同伴智能体策略的“相关一致性”(而非简单一致性)来评估学习智能体的策略。我们的方法显式惩罚对弱监督过拟合的策略。除理论保证外,在含噪声奖励的 RL、弱示范的 BC 及标准策略协同训练等任务上的大量评估表明,我们的方法带来显著性能提升,尤其在学环境复杂度或噪声较高时。

关键词

引用

@article{arxiv.2010.01748,
  title  = {Policy Learning Using Weak Supervision},
  author = {Jingkang Wang and Hongyi Guo and Zhaowei Zhu and Yang Liu},
  journal= {arXiv preprint arXiv:2010.01748},
  year   = {2021}
}

备注

NeurIPS 2021