中文

利用后继特征发现多样化近最优策略

人工智能 2022-01-05 v2 机器学习 机器学习

摘要

为同一问题寻找不同解是智力与创造力和对新情境的适应相关的关键方面。在强化学习中,一组多样化策略可用于探索、迁移、层次化与鲁棒性。我们提出 Diverse Successive Policies,一种在后继特征(Successor Features)空间中多样化、同时保证近最优的策略发现方法。我们将该问题形式化为一个约束马尔可夫决策过程(CMDP),其目标是寻找最大化多样性的策略(以内在多样性奖励刻画),同时相对于 MDP 的外在奖励保持近最优。我们还分析了近期提出的鲁棒性奖励与判别性奖励的表现,发现它们对过程初始化敏感,并可能收敛到次优解。为缓解此问题,我们提出新的显式多样性奖励,旨在最小化集合中各策略的后继特征间的相关性。我们在 DeepMind Control Suite 中比较了不同的多样性机制,发现我们所提出的这类显式多样性对于发现 distinct 行为(例如不同的运动模式)十分重要。

关键词

引用

@article{arxiv.2106.00669,
  title  = {Discovering Diverse Nearly Optimal Policies with Successor Features},
  author = {Tom Zahavy and Brendan O'Donoghue and Andre Barreto and Volodymyr Mnih and Sebastian Flennerhag and Satinder Singh},
  journal= {arXiv preprint arXiv:2106.00669},
  year   = {2022}
}