Transformer 是样本高效的世界模型
机器学习
2023-03-02 v2 人工智能
计算机视觉与模式识别
摘要
深度强化学习智能体以著名的样本低效而著称,这极大限制了其在现实问题中的应用。近来,许多基于模型的方法被设计用以解决该问题,其中在世界模型的想象中学习的做法是最突出的途径之一。然而,尽管与模拟环境的 virtually unlimited 交互颇具吸引力,世界模型必须在较长时间内保持准确。受 Transformer 在序列建模任务中成功的启发,我们提出 IRIS,一种数据高效的智能体,其在由离散自编码器与自回归 Transformer 构成的世界模型中学习。在 Atari 100k 基准上仅相当于两小时游戏时长的情况下,IRIS 取得了 1.046 的平均人类归一化分数,并在 26 个游戏中 10 个上超越人类,为无前瞻搜索的方法确立了新的 SOTA。为促进未来关于 Transformer 与世界模型用于样本高效强化学习的研究,我们在 https://github.com/eloialonso/iris 发布了代码与模型。
引用
@article{arxiv.2209.00588,
title = {Transformers are Sample-Efficient World Models},
author = {Vincent Micheli and Eloi Alonso and François Fleuret},
journal= {arXiv preprint arXiv:2209.00588},
year = {2023}
}
备注
ICLR 2023 (notable top 5%)