循环超网络在元强化学习中出奇地强大
机器学习
2023-12-27 v4 人工智能
机器人学
摘要
深度强化学习(RL)因样本效率低而声名狼藉,难以实际部署。元强化学习通过在可获得相关任务分布进行元训练时学习执行少样本学习,直接解决了这一样本效率低下的问题。尽管已提出许多专门的元强化学习方法,近期工作表明,结合现成序列模型(如循环网络)的端到端学习是一个出奇强大的基线。然而,由于支持证据有限,此类主张一直存在争议,尤其是在先前工作明确得出相反结论的情况下。本文中,我们进行了实证调研。虽然我们同样发现循环网络能取得强劲性能,但我们证明超网络的使用对最大化其潜力至关重要。出奇的是,当与超网络结合时,远比现有专门方法简单的循环基线实际上取得了所有评估方法中最强的性能。我们在 https://github.com/jacooba/hyper 提供了代码。
引用
@article{arxiv.2309.14970,
title = {Recurrent Hypernetworks are Surprisingly Strong in Meta-RL},
author = {Jacob Beck and Risto Vuorio and Zheng Xiong and Shimon Whiteson},
journal= {arXiv preprint arXiv:2309.14970},
year = {2023}
}
备注
Published at NeurIPS 2023. We provide code at https://github.com/jacooba/hyper