中文

为多阶段强化学习任务开发协作策略

机器学习 2022-05-12 v1 人工智能

摘要

许多分层强化学习算法利用一系列独立技能作为在更高推理层次上解决问题的基元。这些算法未考虑使用协作而非独立的技能所具有的价值。本文提出协作连续策略(CCP)方法,使连续智能体协作解决长时域多阶段任务。该方法通过修改每个智能体的策略以最大化当前及下一智能体的评论家(critic)来实现。协作最大化评论家使每个智能体采取对其自身任务及后续任务均有益的动作。在多房间迷宫域与钉入孔操作域中使用该方法,协作策略能够优于一组朴素策略、在整个域上训练的单智能体以及另一种序列HRL算法。

关键词

引用

@article{arxiv.2205.05230,
  title  = {Developing cooperative policies for multi-stage reinforcement learning tasks},
  author = {Jordan Erskine and Chris Lehnert},
  journal= {arXiv preprint arXiv:2205.05230},
  year   = {2022}
}

备注

This paper supersedes the rejected paper "Developing cooperative policies for multi-stage tasks". arXiv admin note: substantial text overlap with arXiv:2007.00203