使用弱监督的策略学习
机器学习
2021-11-03 v3 人工智能
机器学习
摘要
大多数现有策略学习方案要求学习智能体接收高质量监督信号,例如强化学习(RL)中精心设计的奖励或行为克隆(BC)中的高质量专家示范。这些高质量监督在实践中通常难以获得或成本高昂。我们旨在构建一个统一框架,利用可用的廉价弱监督高效执行策略学习。为处理该问题,我们将“弱监督”视为来自同伴智能体的不完美信息,并基于与同伴智能体策略的“相关一致性”(而非简单一致性)来评估学习智能体的策略。我们的方法显式惩罚对弱监督过拟合的策略。除理论保证外,在含噪声奖励的 RL、弱示范的 BC 及标准策略协同训练等任务上的大量评估表明,我们的方法带来显著性能提升,尤其在学环境复杂度或噪声较高时。
引用
@article{arxiv.2010.01748,
title = {Policy Learning Using Weak Supervision},
author = {Jingkang Wang and Hongyi Guo and Zhaowei Zhu and Yang Liu},
journal= {arXiv preprint arXiv:2010.01748},
year = {2021}
}
备注
NeurIPS 2021