APF+: 用于高维游戏的 W 形网络增强自适应潜在函数强化学习方法
机器学习
2025-03-19 v1 人工智能
摘要
近年来,由于其加速训练的能力,奖励塑形在强化学习(RL)中取得了显著发展。我们之前的工作提出了一种自适应潜在函数(APF),并证明了 APF 在低维域中可加速 Q-learning 算法。本文提出将 APF 与编码器(APF+)相结合,用于 RL 状态表示,使其能够应用 APF 于基于像素的 Atari 游戏中,通过一种将高维游戏像素帧投影到低维嵌入的状态编码方法。我们通过设计状态表示编码器为 W 形网络(W-Net),从而能够对游戏帧中的背景以及移动实体进行编码。具体而言,来自预训练 W-Net 的嵌入由两个潜向量组成:一个代表输入状态,另一个代表输入状态表示与自身之间的偏差。我们将 W-Net 整合到 APF 中,用于训练下游 Dueling Deep Q-Network(DDQN),获得 APF-WNet-DDQN,并在 Atari 游戏玩法任务中展示了其有效性。为评估 APF+W-Net 模块在高维任务中的表现,我们与两种基线方法进行比较:(i)基本 DDQN;(ii)两种替换 W-Net 的编码器型 APF-DDQN 方法,其中一种是基于无监督状态表示的方法称为时空深度信息最大化(ST-DIM),另一种是来自 Atari 注释 RAM 接口(ARI)提供的ground truth 状态表示。实验结果表明,在 20 个 Atari 游戏中,APF-WNet-DDQN 在 14 个游戏中显著优于 DDQN,在 13 个游戏中显著优于 APF-STDIM-DDQN。相对于采用来自详细游戏内部状态信息的嵌入的 APF-ARI-DDQN,APF-WNet-DDQN 实现了相当水平的性能。
引用
@article{arxiv.2503.13557,
title = {APF+: Boosting adaptive-potential function reinforcement learning methods with a W-shaped network for high-dimensional games},
author = {Yifei Chen and Lambert Schomaker},
journal= {arXiv preprint arXiv:2503.13557},
year = {2025}
}
备注
46 pages