基于离散抽象表示的变换器学习法:DART
机器学习
2024-06-04 v1
摘要
利用变换器模型的基于模型的强化学习代理因其建模扩展上下文能力而在样本效率方面取得了改进,但这些方法主要依赖连续表示以处理复杂的推理和规划任务。这使得对现实世界中如对象类别之间不可插值的离散属性建模变得复杂。本文引入离散抽象表示用于变换器学习(DART),这是一种高效的方法,利用离散表示来建模世界及学习行为。我们采用变换器解码器进行自回归世界建模,采用变换器编码器通过注意力关注世界模型中与任务相关的线索来学习行为。为处理部分可观测性,我们将过去时间步的感知信息聚合为记忆标记。DART在Atari 100k样本效率基准上超过了不使用提前搜索的前沿方法,中位人类归一化得分为0.790,并在26个游戏中击败了人类。我们在https://pranaval.github.io/DART/发布了代码。
引用
@article{arxiv.2406.01361,
title = {Learning to Play Atari in a World of Tokens},
author = {Pranav Agarwal and Sheldon Andrews and Samira Ebrahimi Kahou},
journal= {arXiv preprint arXiv:2406.01361},
year = {2024}
}
备注
Accepted at ICML 2024