中文

检索增强决策变换器:用于In-context RL的外部记忆

机器学习 2025-08-14 v3 人工智能

摘要

In-context学习(ICL)是模型通过观察其上下文中的少数示例来学习新任务的能力。虽然在NLP中广泛存在,但这种能力最近也在强化学习(RL)中被观察到。然而,现有的In-context RL方法需要整个情节(episode)成为智能体的上下文。鉴于复杂环境通常导致较长的情节且奖励稀疏,这些方法受限于简单且情节较短的环境。为此,我们引入检索增强决策变换器(RA-DT)。RA-DT采用外部记忆机制存储过去的经验,并仅检索与当前情境相关的子情节。RA-DT的检索组件无需训练,可完全基于领域独立。我们在网格世界、机器人模拟和程序生成视频游戏上评估了RA-DT的能力。在网格世界上,RA-DT超过了基线方法,同时仅使用了它们上下文长度的很小一部分。此外,我们阐明了当前In-context RL方法在复杂环境中的局限性,并讨论了未来方向。为促进未来研究,我们发布了四个考虑环境的数据集。

关键词

引用

@article{arxiv.2410.07071,
  title  = {Retrieval-Augmented Decision Transformer: External Memory for In-context RL},
  author = {Thomas Schmied and Fabian Paischer and Vihang Patil and Markus Hofmarcher and Razvan Pascanu and Sepp Hochreiter},
  journal= {arXiv preprint arXiv:2410.07071},
  year   = {2025}
}