学习聚焦:在部分可观测强化学习中利用结构化注意力机制优先排序有信息历史
机器学习
2025-11-11 v1 人工智能
摘要
Transformer 在建模长期依赖方面表现突出,日益被用于部分可观测模型基强化学习(RL)中的世界模型。然而,与自然语言语料库不同,RL 轨迹稀疏且以奖励为驱动,使得标准自注意力机制在分配注意力时在所有过去标记之间均匀分布,而非强调对控制关键的少数转换。为此,我们在 dynamics 头的自注意力机制中引入结构化归纳先验:(i) 每个注意力头的记忆长度先验约束注意力于任务特定窗口;(ii) 分布式先验学习对过去状态-动作对的平滑高斯加权。我们将这些机制集成到支持部分可观测规划的 UniZero 中。这一基于 Transformer 的世界模型强化学习智能体。实验在 Atari 100k 基准上显示,大多数效率提升来自高斯先验,该先验平滑分配注意力于有信息的转换,而记忆长度先验常因过于严格的截断而削弱有用信号。特别是,高斯注意力相较于 UniZero 在平均人类归一化分数上实现了 77% 的相对提升。这些发现表明,在部分可观测 RL 领域中具有非平稳时序依赖关系,离散记忆窗口难以可靠学习,而平滑分布式先验在跨时域上灵活适应,提供更稳健的数据效率。总体而言,我们的结果表明,将结构化时序先验直接编码到自注意力中,可提高部分可观测情境下对有信息历史的优先排序。
关键词
引用
@article{arxiv.2511.06946,
title = {Learning to Focus: Prioritizing Informative Histories with Structured Attention Mechanisms in Partially Observable Reinforcement Learning},
author = {Daniel De Dios Allegue and Jinke He and Frans A. Oliehoek},
journal= {arXiv preprint arXiv:2511.06946},
year = {2025}
}
备注
Accepted to Embodied World Models for Decision Making (EWM) Workshop at NeurIPS 2025