中文

强化学习中通过语言模型进行历史压缩

机器学习 2023-02-22 v4 计算与语言 机器学习

摘要

在部分可观测马尔可夫决策过程(POMDP)中,智能体通常用过去的表示来近似底层 MDP。我们提出利用冻结的预训练语言 Transformer(PLT)进行历史表示与压缩,以提高样本效率。为避免训练 Transformer,我们引入 FrozenHopfield,其自动将观测与预训练词嵌入关联。为形成这些关联,现代 Hopfield 网络存储这些词嵌入,并通过由观测的随机但固定投影获得的查询来检索。我们的新方法 HELM 支持包含预训练语言 Transformer 作为记忆模块用于历史表示的 actor-critic 网络架构。由于无需学习过去的表示,HELM 比竞争方法样本效率高得多。在 Minigrid 和 Procgen 环境中,HELM 取得了新的最先进结果。我们的代码可在 https://github.com/ml-jku/helm 获取。

关键词

引用

@article{arxiv.2205.12258,
  title  = {History Compression via Language Models in Reinforcement Learning},
  author = {Fabian Paischer and Thomas Adler and Vihang Patil and Angela Bitto-Nemling and Markus Holzleitner and Sebastian Lehner and Hamid Eghbal-zadeh and Sepp Hochreiter},
  journal= {arXiv preprint arXiv:2205.12258},
  year   = {2023}
}

备注

ICML 2022