面向可变动作空间的上下文强化学习
机器学习
2024-07-02 v6 人工智能
摘要
最近研究表明,在具有多回合上下文的多样化数据集上预训练的 transformers 能够在上下文中泛化到新的强化学习任务。先前提出的模型的一个关键局限在于它们依赖于预定义的动作空间大小和结构。引入新的动作空间通常需要重新收集数据和重新训练模型,这对于某些应用来说可能成本高昂。在我们的工作中,我们表明可以通过提出 Headless-AD 模型来缓解这一问题,该模型尽管只训练一次,却能够泛化到具有可变大小、语义内容和顺序的离散动作空间。通过对伯努利和上下文赌博机以及网格世界环境的实验,我们表明 Headless-AD 表现出显著的泛化到其从未遇到过的动作空间的能力,甚至在几种环境配置上优于针对特定动作集合训练的专用模型。实现可在以下地址获取:https://github.com/corl-team/headless-ad。
引用
@article{arxiv.2312.13327,
title = {In-Context Reinforcement Learning for Variable Action Spaces},
author = {Viacheslav Sinii and Alexander Nikulin and Vladislav Kurenkov and Ilya Zisman and Sergey Kolesnikov},
journal= {arXiv preprint arXiv:2312.13327},
year = {2024}
}
备注
ICML 2024