中文

SplAgger:用于元强化学习的分裂聚合策略

机器学习 2024-06-04 v3 人工智能

摘要

强化学习 (RL) 的核心目标之一是创建能够在新颖任务中快速学习的智能体。元强化学习 (Meta-RL) 旨在通过直接学习此类智能体来实现这一目标。黑盒方法通过端到端训练现成的序列模型来实现这一点。相比之下,任务推断方法通常使用不同的目标和专为任务推断设计的序列模型,显式地推断未知任务的后验分布。最近的研究表明,强性能并不一定需要任务推断方法。然而,即使不使用任务推断目标,任务推断序列模型是否仍然有益尚不清楚。在本文中,我们提供了证据表明任务推断序列模型确实仍然有益。具体而言,我们研究了具有置换不变聚合的序列模型,这些模型利用了由于马尔可夫性质,任务后验不依赖于数据顺序这一事实。我们在不使用任务推断目标的情况下,实证确认了置换不变序列模型的优势。然而,我们也惊讶地发现,在多种条件下置换变异性仍然有用。因此,我们提出了 SplAgger,它同时使用置换变性和不变性组件以兼得两者之长,在连续控制和记忆环境的所有基线评估中均表现出色。代码地址:https://github.com/jacooba/hyper。

关键词

引用

@article{arxiv.2403.03020,
  title  = {SplAgger: Split Aggregation for Meta-Reinforcement Learning},
  author = {Jacob Beck and Matthew Jackson and Risto Vuorio and Zheng Xiong and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2403.03020},
  year   = {2024}
}

备注

Published at Reinforcement Learning Conference (RLC) 2024. Code is provided at https://github.com/jacooba/hyper