强化学习中通过语言模型进行历史压缩
机器学习
2023-02-22 v4 计算与语言
机器学习
摘要
在部分可观测马尔可夫决策过程(POMDP)中,智能体通常用过去的表示来近似底层 MDP。我们提出利用冻结的预训练语言 Transformer(PLT)进行历史表示与压缩,以提高样本效率。为避免训练 Transformer,我们引入 FrozenHopfield,其自动将观测与预训练词嵌入关联。为形成这些关联,现代 Hopfield 网络存储这些词嵌入,并通过由观测的随机但固定投影获得的查询来检索。我们的新方法 HELM 支持包含预训练语言 Transformer 作为记忆模块用于历史表示的 actor-critic 网络架构。由于无需学习过去的表示,HELM 比竞争方法样本效率高得多。在 Minigrid 和 Procgen 环境中,HELM 取得了新的最先进结果。我们的代码可在 https://github.com/ml-jku/helm 获取。
引用
@article{arxiv.2205.12258,
title = {History Compression via Language Models in Reinforcement Learning},
author = {Fabian Paischer and Thomas Adler and Vihang Patil and Angela Bitto-Nemling and Markus Holzleitner and Sebastian Lehner and Hamid Eghbal-zadeh and Sepp Hochreiter},
journal= {arXiv preprint arXiv:2205.12258},
year = {2023}
}
备注
ICML 2022