中文

利用 DOMiNO 发现策略:保持近最优性的多样性优化

人工智能 2023-02-06 v2 机器学习

摘要

为同一问题寻找不同解是智力与创造力和对新情境的适应相关的关键方面。在强化学习中,一组多样的策略可用于探索、迁移、层次化和鲁棒性。我们提出 DOMiNO,一种保持近最优性的多样性优化(Diversity Optimization Maintaining Near Optimality)方法。我们将该问题形式化为一个约束马尔可夫决策过程,其目标是寻找多样的策略(由集合中各策略状态占用度之间的距离度量),同时相对于外在奖励保持近最优。我们证明该方法能在多种领域中发现有意义的多样行为,例如 DeepMind Control Suite 中不同的运动模式。我们对我们的方法进行了广泛分析,将其与其他多目标基线进行比较,证明我们可通过可解释的超参数控制集合的质量与多样性,并展示所发现的集合对扰动具有鲁棒性。

关键词

引用

@article{arxiv.2205.13521,
  title  = {Discovering Policies with DOMiNO: Diversity Optimization Maintaining Near Optimality},
  author = {Tom Zahavy and Yannick Schroecker and Feryal Behbahani and Kate Baumli and Sebastian Flennerhag and Shaobo Hou and Satinder Singh},
  journal= {arXiv preprint arXiv:2205.13521},
  year   = {2023}
}