中文

多样性诱导策略梯度:利用最大均值差异寻找一组多样化策略

机器学习 2019-06-04 v1 机器学习

摘要

标准强化学习方法旨在掌握解决任务的一种途径,而可能存在多种近最优策略。能够识别这组近最优策略可让领域专家高效地探索合理解的空间。遗憾的是,现有量化策略不确定性的方法最终与寻找具有质性不同行为的策略无关。在本工作中,我们将策略之间的差异形式化为各策略所诱导轨迹分布之间的差异,从而鼓励在状态访问和动作选择两方面的多样性。我们推导了一种基于梯度的优化技术,可结合现有策略梯度方法来识别表现良好的多样化策略集合。我们在基准测试和一项医疗任务上展示了我们的方法。

关键词

引用

@article{arxiv.1906.00088,
  title  = {Diversity-Inducing Policy Gradient: Using Maximum Mean Discrepancy to Find a Set of Diverse Policies},
  author = {Muhammad A. Masood and Finale Doshi-Velez},
  journal= {arXiv preprint arXiv:1906.00088},
  year   = {2019}
}