中文

启发式变换器:信念增强的基于上下文的强化学习

机器学习 2025-11-14 v1 人工智能

摘要

变换器已展示出在上下文学习方面的卓越能力,使其在自然语言处理、计算机视觉和序列决策等领域得到广泛应用。在强化学习中,上下文学习将学习框架重新定义为监督学习问题,从而实现无需参数更新的任务适应。基于利用变换器进行序列决策的 prior work,我们提出了启发式变换器(Heuristic Transformer, HT),这是一种在上下文强化学习(in-context reinforcement learning, IRL)方法,通过在上下文数据集中增强奖励分布的信念来实现更好的决策。我们采用变分自编码器(Variational Auto-Encoder, VAE),学习一个低维随机变量来表示奖励后验分布的分布,并将其与上下文数据集和查询状态一起作为变换器策略的提示输入。我们在 Darkroom、Miniworld 和 MuJoCo 环境中评估了 HT 的性能,结果表明其在有效性和泛化能力方面 consistently 优于 comparable baselines。该方法为在信念增强与变换器决策之间架起桥梁的前景方向提供了可能性。

关键词

引用

@article{arxiv.2511.10251,
  title  = {Heuristic Transformer: Belief Augmented In-Context Reinforcement Learning},
  author = {Oliver Dippel and Alexei Lisitsa and Bei Peng},
  journal= {arXiv preprint arXiv:2511.10251},
  year   = {2025}
}