AMAGO:面向自适应智能体的可扩展上下文内强化学习
机器学习
2024-02-02 v4
摘要
我们介绍了 AMAGO,一种利用序列模型应对泛化、长期记忆与元学习挑战的上下文内强化学习(RL)智能体。近期工作表明,离屏学习可使基于循环策略的上下文内 RL 成为可能。然而,这些方法需要大量调参,并通过在智能体记忆容量、规划时域和模型规模上制造关键瓶颈来限制可扩展性。AMAGO 重新审视并重新设计了离屏上下文内方法,以成功地在端到端 RL 中并行训练整个 rollout 上的长序列 Transformer。我们的智能体具有可扩展性,适用于广泛的问题,并在元 RL 与长期记忆领域中以实证展示了其强劲性能。AMAGO 对稀疏奖励与离屏数据的关注,也使上下文内学习可扩展到具有挑战性探索的目标条件问题。当与多目标后见重标方案结合时,AMAGO 能够解决一类此前困难的开放世界领域,其中智能体在程序生成的环境中完成许多可能的指令。
引用
@article{arxiv.2310.09971,
title = {AMAGO: Scalable In-Context Reinforcement Learning for Adaptive Agents},
author = {Jake Grigsby and Linxi Fan and Yuke Zhu},
journal= {arXiv preprint arXiv:2310.09971},
year = {2024}
}
备注
ICLR 2024