中文

PaCo:参数组合式多任务强化学习

机器学习 2022-10-24 v1 人工智能 机器人学

摘要

多任务强化学习(MTRL)的目的是训练一个可应用于一组不同任务的单一策略。共享参数使我们能够利用任务之间的相似性。然而,不同任务在内容与难度上的差距给我们应该让哪些任务共享参数、共享哪些参数以及由参数共享带来的优化挑战带来了困难。在这项工作中,我们引入了一种参数组合式方法(PaCo)以尝试应对这些挑战。在该框架中,学习一个由一组参数表示的政策子空间。所有单任务的策略都位于该子空间内,并可通过与所学集合的插值进行组合。它不仅允许灵活的参数共享,也提供了一种改进训练的自然方式。我们在Meta-World基准上展示了最先进的性能,验证了所提方法的有效性。

关键词

引用

@article{arxiv.2210.11653,
  title  = {PaCo: Parameter-Compositional Multi-Task Reinforcement Learning},
  author = {Lingfeng Sun and Haichao Zhang and Wei Xu and Masayoshi Tomizuka},
  journal= {arXiv preprint arXiv:2210.11653},
  year   = {2022}
}

备注

19 pages