AMAGO-2:利用 Transformer 突破元强化学习中的多任务障碍
机器学习
2024-11-19 v1
摘要
在多样化数据集上训练的语言模型通过上下文学习解锁了泛化能力。强化学习策略可以通过在序列模型的记忆中进行元学习来达到类似效果。然而,元强化学习研究主要集中在适应单一任务的微小变化上。若不应对多任务优化中的挑战,就很难扩展到更通用的行为,并且很少有解决方案能与元强化学习从大规模无标签任务训练集中学习的目标兼容。为了解决这一挑战,我们重新审视了多任务强化学习因不同任务间回报尺度不均而产生的训练损失不平衡这一瓶颈。我们基于 Transformer(上下文)元强化学习的最新进展,评估了一种简单且可扩展的解决方案,即将智能体的 Actor 和 Critic 目标都转换为分类项,从而使优化与当前的回报尺度解耦。在 Meta-World ML45、Multi-Game Procgen、Multi-Task POPGym、Multi-Game Atari 和 BabyAI 上的大规模比较发现,这种设计在没有明确任务标签的情况下,在在线多任务适应和记忆问题上取得了显著进展。
引用
@article{arxiv.2411.11188,
title = {AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers},
author = {Jake Grigsby and Justin Sasek and Samyak Parajuli and Daniel Adebi and Amy Zhang and Yuke Zhu},
journal= {arXiv preprint arXiv:2411.11188},
year = {2024}
}
备注
NeurIPS 2024